{"as_of":"2026-08-13T07:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:252d33804303b603e229b8166aa3811e4146c39d1e004b8984cedabd0c42441c","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:13:11.939403Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17537/citation-record","integrity":"/paper/2411.17537/integrity","json":"/paper/2411.17537/citation-record.json","paper":"/paper/2411.17537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.378382Z","title":"Improving proper noun recog- nition in end-to-end asr by customization of the mwer loss criterion,","venue":null,"work_id":"ee31987c-4c7c-44a7-b262-adbf5aa9f8fa","year":2020},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.816274Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:273fa99455a20de1828c0eb794e433859d7fdfa45f14ade4684938faca9187c1","observation_id":"d1fb53bf-ccba-4b84-8587-837ac432bed3","resolution":{"observed_at":"2026-08-12T12:13:12.383662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.361662Z","title":"Personalization of end-to-end speech recognition on mobile devices for named entities,","venue":null,"work_id":"f1bba8cc-5cce-45e6-9abe-22044b8e64aa","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.821661Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:fe50747c00c3fa1e28823d2a89754a527f55aa4f09e74e5de8788d87c8337bc9","observation_id":"171e2db0-00b3-48bc-b65f-c505cbef4ef0","resolution":{"observed_at":"2026-08-12T12:13:12.367127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-10T09:30:53.884156Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-12T12:13:11.826465Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.826465Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:10256297780cbfb936f6285efb844ffcb7809dde39497b312511ad8d33eb996f","observation_id":"b12b8d2b-9278-414c-878c-72d4e96a80d5","resolution":{"observed_at":"2026-08-12T12:13:11.826465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13516","last_updated":"2023-05-22T22:09:41Z","snapshot_observed_at":"2026-08-12T21:09:34.852601Z","submitted_at":"2023-05-22T22:09:41Z","title":"Scaling Speech Technology to 1,000+ Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13516","snapshot_observed_at":"2026-08-12T12:13:11.831434Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.831434Z"},"links":{"cited_paper":"/paper/2305.13516","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:725c1e6b743221f80b928ede31de55dd31fbc6968f6bf310dd6ce8753d562522","observation_id":"a600b9bd-bfdb-40d5-8f86-e50a9f9d4cc9","resolution":{"observed_at":"2026-08-12T12:13:11.831434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.345726Z","title":"A better and faster end-to- end model for streaming asr,","venue":null,"work_id":"1212270a-576a-42bb-a42b-53021dff3dc8","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.836718Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:bb3ed4da575a468db1ad642df19b19cd1a8c2f7e31eaa8d49126ad981698e5b8","observation_id":"7cad08d1-e2ab-45dd-aa9a-37f66686eb3a","resolution":{"observed_at":"2026-08-12T12:13:12.350590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.330709Z","title":"Cascaded encoders for unifying streaming and non-streaming asr,","venue":null,"work_id":"6178772f-f971-40fb-b829-372c2480d703","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.841431Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:4bf3bef4091b5c5177e211a15dee314f8c0ce5128259a3eb4324b904a98ceac5","observation_id":"8d1623b1-1960-4911-9663-a6a033a65439","resolution":{"observed_at":"2026-08-12T12:13:12.335630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.315496Z","title":"Dual-mode asr: Unify and improve streaming asr with full-context modeling,","venue":null,"work_id":"b39a59f8-7fe8-44fd-b16a-a0d6248ad503","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.846582Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:599ebf6c351fe1d79b11ca33ef1687859b39a1f6ebc1b6bd0c34d6ebdc4f78be","observation_id":"6f2010c9-a873-4e92-b3ba-2c06ffbcbeff","resolution":{"observed_at":"2026-08-12T12:13:12.320471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:11.851129Z","title":"Deep neural networks for acoustic modeling in speech recognition: The shared views of four research groups,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.851129Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:9c1af09fc8d6b6acb5f0f2a1617b1ed9b83a7132e9b3b51172ee5797af00edfc","observation_id":"5a344ed2-2b68-45de-9f4d-a90fc9b05648","resolution":{"observed_at":"2026-08-12T12:13:11.851129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.289985Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recur- rent neural networks,","venue":null,"work_id":"a43a14f4-5b6d-4411-971c-7a167eb99476","year":2006},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.855609Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:0c27dd7f3b950b1f58589d2617bbc7a5dff3f9fd8729238bdd7f0689eda13c70","observation_id":"b46cab54-a763-478d-a4e9-e98026def95a","resolution":{"observed_at":"2026-08-12T12:13:12.294940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.273759Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"6cf8a2fc-b56e-4719-bffd-1f76eee87e94","year":2012},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.860027Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:1ced2873d030815a31f15e255a4563ab0fb8ccd52f818ec12cbc496216203512","observation_id":"d4108838-eac7-4adb-9417-b30939bcd4d3","resolution":{"observed_at":"2026-08-12T12:13:12.279887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.259025Z","title":"End-to-end attention-based large vocabulary speech recognition,","venue":null,"work_id":"581d1a66-8f78-4087-8e12-a19a51f8d333","year":2016},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.864442Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:710aeba261316085767b3706a052565aa451e8f63ba34fdd1bbdce1944099096","observation_id":"0b875d82-d58c-4c7a-9d4b-53ce49212ab7","resolution":{"observed_at":"2026-08-12T12:13:12.263759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.244477Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":"38cb6430-8560-4fc8-a5a1-a84794d79a61","year":2016},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.870010Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:6260573e2288cc15145fac30cc23aafb6440509c59147273405bdb04ac574804","observation_id":"3e4a5c99-a609-41d8-b611-ac70dfbab78f","resolution":{"observed_at":"2026-08-12T12:13:12.249338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11235","last_updated":"2020-02-12T11:13:58Z","snapshot_observed_at":"2026-07-06T07:55:49.495023Z","submitted_at":"2019-05-27T14:00:45Z","title":"CIF: Continuous Integrate-and-Fire for End-to-End Speech Recognition","version":4},"cited_work":{"arxiv_id":"1905.11235","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.11235","snapshot_observed_at":"2026-08-12T12:13:12.009517Z","title":"CIF: Continuous Integrate-and-Fire for End-to-End Speech Recognition","venue":"cs.CL","work_id":"6db310f3-536a-456e-8be9-d2cea6143ad4","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.875107Z"},"links":{"cited_paper":"/paper/1905.11235","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:629f0682f899fd1ebadb778731135a49c328df069196c66ebc791b113a60aac9","observation_id":"4d9306e7-1ed0-4a94-89ec-db00dc4286a2","resolution":{"observed_at":"2026-08-12T12:13:12.016770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.229408Z","title":"Crf-based single-stage acoustic modeling with ctc topology,","venue":null,"work_id":"0e83d6a6-dd9e-4a4b-8282-9d35f8d48d17","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.879782Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:88fe91e6a56fab270a3d99c26e7d37b0c1f370541ec2d9b057619aefc5792826","observation_id":"10e80c2f-73f4-4c60-b04a-aa19bcfc006b","resolution":{"observed_at":"2026-08-12T12:13:12.234353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.214416Z","title":"Imputer: Sequence modelling via imputation and dynamic programming,","venue":null,"work_id":"6da74628-5bf6-4b88-9911-dda06d2eb5e0","year":2020},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.884138Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:533d8f440a592878f8f65081595236ad209d70decd8310c530ed59735e2e081c","observation_id":"5903ca51-3a82-4b88-a792-a8a449583128","resolution":{"observed_at":"2026-08-12T12:13:12.219564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.199217Z","title":"Global normalization for streaming speech recognition in a modular framework,","venue":null,"work_id":"64fe99a3-15cc-4c69-9293-2bb594ff5e3c","year":2022},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.888434Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:9f7ba6163d59962664a1b16ede30c2a0f36c76e76f3d80485807c3ee63687a2a","observation_id":"e9b2fdcd-caf4-44c9-880f-b99446e699a6","resolution":{"observed_at":"2026-08-12T12:13:12.204049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.184169Z","title":"An unsupervised autoregressive model for speech representation learning,","venue":null,"work_id":"a46262d5-d0d6-4da2-8ba4-485dae78fca6","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.893079Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:dcbe4829f14a771f0d81eb39a5f197f2317a8461a6c32950dabb43193e805f69","observation_id":"c55bfd57-f5ec-470f-bc88-34313b235760","resolution":{"observed_at":"2026-08-12T12:13:12.189145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.169205Z","title":"Variational inference with normalizing flows,","venue":null,"work_id":"c212a152-f2b5-422d-b12a-454fb381ec4a","year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.897533Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:1c51b3a6e97b16d35dd7ef2d5efbbe5d6a558eabbb8dd6b656c02fd2e8562412","observation_id":"7d281fd7-cbe5-4a1f-9e41-fb57c8f17546","resolution":{"observed_at":"2026-08-12T12:13:12.174075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.154293Z","title":"https://github.com/k2-fsa/icefall","venue":null,"work_id":"c009cc25-190a-4e15-84f2-e0f105a0d118","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.901971Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:9b0e2aef18569a92846dc54379ca9675f72f96d8155d27eb2a1dd8c07db3e675","observation_id":"0d4597f1-bc0a-447f-9fe8-b7d039341609","resolution":{"observed_at":"2026-08-12T12:13:12.158985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.138418Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"9cc00695-41f4-40cf-a317-1a6655ba46c0","year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.906742Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:6ac1ce90e9be3c69e4ae260656880668a93de5730459099b4474a62349e0f4f9","observation_id":"7eef7b32-dfc2-4500-b436-de80460cd04d","resolution":{"observed_at":"2026-08-12T12:13:12.143688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.122525Z","title":"Ted-lium 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":"85181b2f-6b1c-4c54-a67b-7ed085c3b149","year":2018},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.911102Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:645870bcba5d2254ad058836d30ded4021f6ea0d6af1f0d1e2eef3bc52a573c0","observation_id":"343bbec1-16af-49d8-8430-fb1ee3a486aa","resolution":{"observed_at":"2026-08-12T12:13:12.127432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.107567Z","title":"A new algorithm for data compression,","venue":null,"work_id":"4aadd711-4d69-4954-9027-708ca2b88db7","year":1994},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.915698Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:33dcea8f295c11c2fc5a3e3353a983f8869eeb775bd1c3dbe0a80062ef305b1d","observation_id":"74753a00-dfa4-4b74-83f1-23b4aadd3664","resolution":{"observed_at":"2026-08-12T12:13:12.112275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T03:19:10.079224Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-12T12:13:11.920124Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.920124Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:5bff8534be49f874821c6cfcd7d871debd397a5eeda5215a6e01141f8a2c1937","observation_id":"1f671f66-86ad-4e7b-84ce-7b688cad4f50","resolution":{"observed_at":"2026-08-12T12:13:11.920124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-08-13T05:47:38.366792Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-12T12:13:11.925137Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.925137Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:b0e40d69b52dbe48493f9c229c8637b41adaa0e151ffff84258038ed4b4f1f2c","observation_id":"28b369b5-17ba-4972-859f-618ccaef638b","resolution":{"observed_at":"2026-08-12T12:13:11.925137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.092282Z","title":"Rnn- transducer with stateless prediction network,","venue":null,"work_id":"659dc890-e72e-42d6-be20-2e02be540ff7","year":2020},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.930273Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:a3ce64c46c00a6e9ec0defad1222edf634f2e9bac3bbaf2963af2d04080482f7","observation_id":"250cd683-1af0-4a57-91ea-0b7d501eabd6","resolution":{"observed_at":"2026-08-12T12:13:12.097217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.076742Z","title":"Made: Masked autoencoder for distribution estimation,","venue":null,"work_id":"a04ae4d9-a05c-44e2-8bbb-12c952ad5926","year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.934933Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:23e11bfe681a856be9a06cc3f88514fc983121ea31f983286ecc23ac9d155307","observation_id":"011b3b63-fd94-4e61-8ad7-803d89938d9e","resolution":{"observed_at":"2026-08-12T12:13:12.081969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.061406Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"a0d3fe1d-b0a5-4493-a432-b22131b9588a","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.939403Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:bc270d4110a95f553ea4a5e02892c64f95e39348b841ff1f1219b7d5ec341486","observation_id":"42beed4c-1604-49a0-8c7b-e468d514b2cb","resolution":{"observed_at":"2026-08-12T12:13:12.066442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T21:10:06.990105Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2411.17537."}