{"as_of":"2026-08-08T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ac16299711d6a96d563ec2c2915164d4271c77c2f4563e98efebfe0dfb646a0","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:02:26.521767Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:02:25.274818Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:02:27.830832Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.03722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03722","snapshot_observed_at":"2026-08-07T11:02:27.830832Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","venue":"cs.CL","work_id":"8af7d16e-8e6f-4fef-af74-4b09f2b9d1cc","year":2025},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.274818Z"},"links":{"cited_paper":"/paper/2506.03722","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:72cd3025419182831572d834fc125149bb45cd251b46bf14e3f571fd79e5ce08","observation_id":"a6de1878-e4cb-429f-b45c-fdd1d7fc35da","resolution":{"observed_at":"2026-08-07T11:02:27.864246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03722/citation-record","integrity":"/paper/2506.03722/integrity","json":"/paper/2506.03722/citation-record.json","paper":"/paper/2506.03722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.370232Z","title":null,"venue":null,"work_id":"b23195a3-af8a-452d-8492-7ae365ab5a21","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:24.957407Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:1cf8e967b999a8f241210a0df2d83035649392651b7ab8513a6837c8f1eb2abd","observation_id":"3ad25024-bdbb-43bd-82ed-35bbcc743e63","resolution":{"observed_at":"2026-08-07T11:02:29.421803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.247449Z","title":null,"venue":null,"work_id":"8dcf098d-3743-4d06-b9d5-858209bdda89","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.016140Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:9987f0f984a42967a2fe07786a3c8f48a469620c050e1646a7084546da3f507b","observation_id":"edf492e5-494a-4345-9e56-36093bfe0fa9","resolution":{"observed_at":"2026-08-07T11:02:29.296199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.141385Z","title":null,"venue":null,"work_id":"755fd40a-797f-4744-96f1-1deb483e6e15","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.186704Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:1f6ffda015bee127558a97ba434889d4902e976c5c75705f6cadaa798f401814","observation_id":"61ae056b-096b-47b6-95c9-8ce87a5c861a","resolution":{"observed_at":"2026-08-07T11:02:29.175286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.03722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03722","snapshot_observed_at":"2026-08-07T11:02:27.830832Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","venue":"cs.CL","work_id":"8af7d16e-8e6f-4fef-af74-4b09f2b9d1cc","year":2025},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.274818Z"},"links":{"cited_paper":"/paper/2506.03722","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:72cd3025419182831572d834fc125149bb45cd251b46bf14e3f571fd79e5ce08","observation_id":"a6de1878-e4cb-429f-b45c-fdd1d7fc35da","resolution":{"observed_at":"2026-08-07T11:02:27.864246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.030702Z","title":"Overview As shown in Figure 1, the proposed Streaming-Whisper in- cludes three modules: encoder, decoder, and predictor","venue":null,"work_id":"8a34078f-d633-425c-8d9f-7e683b4a7e95","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.302367Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:1889453ec16b71989adde7a58197a73ffdecc8a870b84eed560a76d58ea0114c","observation_id":"2464d843-68a0-4792-8e0e-b9fc32595a5f","resolution":{"observed_at":"2026-08-07T11:02:29.091497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.911972Z","title":null,"venue":null,"work_id":"a336dbc4-341f-44b8-8d5f-491592849e05","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.331392Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:bb7f35121f0d214ff77f954dc23a11e1cfaf3677f955c396176b0d32c8bd73e3","observation_id":"9e1d1057-e552-497e-8374-3e778eeef719","resolution":{"observed_at":"2026-08-07T11:02:28.959072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.796398Z","title":"Architecture Experiment We implement the Streaming-Whisper framework in various scale architectures, including Small, Medium, Large-V3 and Large-V3-Turbo","venue":null,"work_id":"ab30d147-d23d-40aa-a469-1b46c1bbcee3","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.401724Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:2b64bff554dbd7292e697594b7381576f6216b1277b9c9bb1ffb2ec03b5720df","observation_id":"36560324-ac82-4966-9575-8ad40b073c37","resolution":{"observed_at":"2026-08-07T11:02:28.849332Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.665369Z","title":null,"venue":null,"work_id":"9e119c6e-ee66-4dbd-a08a-7c7e0bbed441","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.460049Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:590966defac20bad65d481e8e277a0b6a9f870f3b6097dd3bced69be6d149574","observation_id":"0f1c753b-bfc5-4811-8aa3-8298fcdd8147","resolution":{"observed_at":"2026-08-07T11:02:28.711144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.523465Z","title":null,"venue":null,"work_id":"389352bb-fe8f-4bfa-9923-8c0586ee55af","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.493698Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:09d4edde2cb3946ae49168836536ffa6278d0eda4dacd84620c2b1edf2cb5137","observation_id":"8f2b1eb9-1a1b-477d-84a5-7b4af285083e","resolution":{"observed_at":"2026-08-07T11:02:28.553468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:25.532368Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.532368Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:4e44e4e709868b7d95e8eafc22959b97b18d54b7481fd27fff44108cac351fd3","observation_id":"e20beac4-c443-4c82-9811-b6d998476be6","resolution":{"observed_at":"2026-08-07T11:02:25.532368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00430","last_updated":"2023-11-01T10:45:07Z","snapshot_observed_at":"2026-08-07T12:00:29.154627Z","submitted_at":"2023-11-01T10:45:07Z","title":"Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00430","snapshot_observed_at":"2026-08-07T11:02:25.579863Z","title":"Distil-whisper: Robust knowledge distillation via large-scale pseudo labelling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.579863Z"},"links":{"cited_paper":"/paper/2311.00430","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:b814929e61cda226df76ca4e0ed1665a5799734a49880ba56462b1b149033906","observation_id":"1f94fa03-a836-493d-946c-a242bb931773","resolution":{"observed_at":"2026-08-07T11:02:25.579863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10788","last_updated":"2024-09-29T05:28:40Z","snapshot_observed_at":"2026-07-06T15:29:05.031168Z","submitted_at":"2023-05-18T08:00:09Z","title":"DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition","version":2},"cited_work":{"arxiv_id":"2305.10788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10788","snapshot_observed_at":"2026-08-07T11:02:27.709724Z","title":"DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition","venue":"cs.SD","work_id":"e12d283f-1960-495f-9b79-8a3050142849","year":2023},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.617059Z"},"links":{"cited_paper":"/paper/2305.10788","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:cfe60dc364bfb6f8e9e4d90753bb5ee737f722886abbb1365756648e9a3b1866","observation_id":"312b581e-6c95-4a2e-a0e8-28fa60791870","resolution":{"observed_at":"2026-08-07T11:02:27.733126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15869","last_updated":"2024-09-24T08:42:31Z","snapshot_observed_at":"2026-07-06T19:21:03.775247Z","submitted_at":"2024-09-24T08:42:31Z","title":"Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15869","snapshot_observed_at":"2026-08-07T11:02:25.664456Z","title":"Whisper in medusa’s ear: Multi-head efficient decod- ing for transformer-based asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.664456Z"},"links":{"cited_paper":"/paper/2409.15869","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:c1907356f97e16690ae742dfdb5f723cb65646c52706738a494cdfba28503282","observation_id":"1d49c508-9bb1-4082-be68-bd869d01d3a7","resolution":{"observed_at":"2026-08-07T11:02:25.664456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.413793Z","title":"Synchronous transformers for end-to-end speech recognition,","venue":null,"work_id":"7dcd0de1-b73e-4aae-be69-437b04f6c882","year":2020},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.698313Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:3f07b4e4743131009536fce2f412f4feceef5bd2998848919d9320c54d71707d","observation_id":"af8b09fb-4e69-423c-85e3-794b6b15300c","resolution":{"observed_at":"2026-08-07T11:02:28.459357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.225250Z","title":"Online and linear-time attention by enforcing monotonic alignments,","venue":null,"work_id":"7a25f29b-80d0-4204-8809-8e2e4d0dcf0a","year":2017},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.737286Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:deda581588c956141c212eabeef9740ad8e85df6a97f73abea87f0b557edfa79","observation_id":"135afe41-8a09-49b1-989e-ed5a59da3c2f","resolution":{"observed_at":"2026-08-07T11:02:28.329494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05218","last_updated":"2019-06-12T15:49:31Z","snapshot_observed_at":"2026-08-07T23:49:03.922415Z","submitted_at":"2019-06-12T15:49:31Z","title":"Monotonic Infinite Lookback Attention for Simultaneous Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05218","snapshot_observed_at":"2026-08-07T11:02:25.795500Z","title":"Monotonic infinite lookback attention for simultaneous machine translation,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.795500Z"},"links":{"cited_paper":"/paper/1906.05218","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:b4360e373921ceea108ffa3cf0ee10200bfaf1c6df414c143b60afcf2b1c3a24","observation_id":"a0acb00d-930b-481c-b734-57ea66cbbfa7","resolution":{"observed_at":"2026-08-07T11:02:25.795500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05382","last_updated":"2018-02-23T01:35:36Z","snapshot_observed_at":"2026-08-03T08:32:46.315607Z","submitted_at":"2017-12-14T18:29:42Z","title":"Monotonic Chunkwise Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05382","snapshot_observed_at":"2026-08-07T11:02:25.841709Z","title":"Monotonic chunkwise attention,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.841709Z"},"links":{"cited_paper":"/paper/1712.05382","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:d6264383a6cc8e7387575cb7f23e04fb158065a80039fbb06a3d47fbcbc88bd7","observation_id":"90548500-351e-441d-ae65-0c34ae69fbe0","resolution":{"observed_at":"2026-08-07T11:02:25.841709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12406","last_updated":"2019-09-26T21:32:50Z","snapshot_observed_at":"2026-08-01T11:32:02.592655Z","submitted_at":"2019-09-26T21:32:50Z","title":"Monotonic Multihead Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12406","snapshot_observed_at":"2026-08-07T11:02:25.867881Z","title":"Monotonic multi- head attention,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.867881Z"},"links":{"cited_paper":"/paper/1909.12406","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:bd9c69fe44cee81950c3f83bb2313d83e376fcccb8714911ffbdaf9f76890592","observation_id":"32b3e10e-9080-475b-96d3-17e399fb5dc0","resolution":{"observed_at":"2026-08-07T11:02:25.867881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08398","last_updated":"2019-06-24T21:35:07Z","snapshot_observed_at":"2026-08-03T06:11:18.979670Z","submitted_at":"2018-10-19T08:37:40Z","title":"STACL: Simultaneous Translation with Implicit Anticipation and Controllable Latency using Prefix-to-Prefix Framework","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08398","snapshot_observed_at":"2026-08-07T11:02:25.916569Z","title":"Stacl: Simultaneous trans- lation with implicit anticipation and controllable latency using prefix-to-prefix framework,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.916569Z"},"links":{"cited_paper":"/paper/1810.08398","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ab1bab0d1255406fb9e237a86283757c2e1174a7a5ed3469c5db3af8311eae0c","observation_id":"441c5d90-9e07-4f27-b643-328065858d35","resolution":{"observed_at":"2026-08-07T11:02:25.916569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11185","last_updated":"2020-10-13T16:18:44Z","snapshot_observed_at":"2026-08-07T01:29:37.417292Z","submitted_at":"2020-05-22T13:42:54Z","title":"Low-Latency Sequence-to-Sequence Speech Recognition and Translation by Partial Hypothesis Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11185","snapshot_observed_at":"2026-08-07T11:02:25.953199Z","title":"Low-latency sequence-to- sequence speech recognition and translation by partial hypothesis selection,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.953199Z"},"links":{"cited_paper":"/paper/2005.11185","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:c7f34989bfdecaf0c9090f229351a4f0dbe472bc20bc3ca60fcc4bdbfea445a2","observation_id":"5aeed60a-53f0-4029-a595-107f8d9e2502","resolution":{"observed_at":"2026-08-07T11:02:25.953199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10052","last_updated":"2024-06-14T14:07:26Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:07:26Z","title":"Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10052","snapshot_observed_at":"2026-08-07T11:02:26.001831Z","title":"Simul-whisper: Attention-guided streaming whisper with truncation detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.001831Z"},"links":{"cited_paper":"/paper/2406.10052","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:352c4a601fc0951546f9aae6d7a228296406c03c8d5c6e03ee8876564aa878c0","observation_id":"03e6669f-85eb-459d-8a15-84f1d2cc1996","resolution":{"observed_at":"2026-08-07T11:02:26.001831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09491","last_updated":"2024-08-18T14:10:35Z","snapshot_observed_at":"2026-08-05T20:02:44.497508Z","submitted_at":"2024-08-18T14:10:35Z","title":"A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition","version":1},"cited_work":{"arxiv_id":"2408.09491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09491","snapshot_observed_at":"2026-08-07T11:02:27.202607Z","title":"A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition","venue":"cs.SD","work_id":"040950a7-6203-4c65-a0fc-203de44205a1","year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.042426Z"},"links":{"cited_paper":"/paper/2408.09491","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:8a134a9d19b9d518ddc37095f06f6fdce0c0643fd00a950b901a72777c44e3b2","observation_id":"56031542-b6dc-4e09-ba41-3d151e88fbc5","resolution":{"observed_at":"2026-08-07T11:02:27.233281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.120379Z","title":"Cif: Continuous integrate-and-fire for end- to-end speech recognition,","venue":null,"work_id":"2875dc0c-34d2-491e-bbe5-7a3019edfdec","year":2020},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.071756Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:272c90638d69b57f7988918c4f1a7039afa449578a1d3861bb31cf622097f1ed","observation_id":"a55a72e4-ac9a-4ea7-831d-3ae2ff1b739b","resolution":{"observed_at":"2026-08-07T11:02:28.159036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T11:02:26.108415Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.108415Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:54dfef9136b1bc72c26f773557cc515c31a4ae8c026c14dd77049ff36d08a422","observation_id":"d174e39a-ca50-44cc-a430-4fe19c142abe","resolution":{"observed_at":"2026-08-07T11:02:26.108415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-07-06T18:27:45.631190Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-07T11:02:26.135591Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model bench- mark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.135591Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:dc8a95522241fccc24f5e8c040e5c3253d16e7d11315bec6028d1113d096e92d","observation_id":"67f74920-be81-43fe-a871-d1ab29ffa4bb","resolution":{"observed_at":"2026-08-07T11:02:26.135591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:26.161343Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.161343Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:4506ba80f0b5d8d2a71e5a4d9b481bfe460e28d1c3264ac952f043c774010923","observation_id":"ce4e93f9-b54e-4734-8df5-1880d97d57f9","resolution":{"observed_at":"2026-08-07T11:02:26.161343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T11:02:26.185556Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.185556Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:d11d5ce0b238645df4ed418e06b73f8f79683c01ffa34bffc2c2f70e9584e8ba","observation_id":"f1ee1185-2fb3-4b55-9f28-3f85c216c1a9","resolution":{"observed_at":"2026-08-07T11:02:26.185556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T11:02:26.212501Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.212501Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ff5402fc7d346e76360ba83d611e6aa930413293a61919bc26d71f87c6b7c274","observation_id":"62cf6209-dec3-431b-98bc-12855fdd7f48","resolution":{"observed_at":"2026-08-07T11:02:26.212501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:02:26.265204Z","title":"Lora: Low-rank adaptation of large lan- guage models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.265204Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:0908d3c03c26548a72d36e671f25a428078c7f73044a9410b98e0af49df53d02","observation_id":"13fd02b6-7e6a-474d-8970-69b72b8e7c2a","resolution":{"observed_at":"2026-08-07T11:02:26.265204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.002362Z","title":"Wenet: Production oriented stream- ing and non-streaming end-to-end speech recognition toolkit,","venue":null,"work_id":"dffee610-f89e-47f8-81c7-28533b9bdbf8","year":2021},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.298875Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:09d1072dad480a89efd845990001a54e64d4d9254466bfaca7f947e69d0422bf","observation_id":"4b14c21e-f6a4-4fc6-b5e8-e07eed1ce21e","resolution":{"observed_at":"2026-08-07T11:02:28.028125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:27.923827Z","title":"A normalized levenshtein distance metric,","venue":null,"work_id":"99fd7395-bcf0-4a82-8a0b-cbb93af16559","year":2007},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.344072Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:56365a3f9aaeffb59f26329c8db9f46f2beadc2e2236c7fcf7d9c2b2ce400d97","observation_id":"bb5a1031-7848-458a-a6eb-8e37522a294d","resolution":{"observed_at":"2026-08-07T11:02:27.953531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00048","last_updated":"2019-05-31T19:57:49Z","snapshot_observed_at":"2026-07-06T07:57:07.607538Z","submitted_at":"2019-05-31T19:57:49Z","title":"Thinking Slow about Latency Evaluation for Simultaneous Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00048","snapshot_observed_at":"2026-08-07T11:02:26.381434Z","title":"Thinking slow about latency eval- uation for simultaneous machine translation,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.381434Z"},"links":{"cited_paper":"/paper/1906.00048","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:a67b414bd2d4b63724d42b7d41f772bdc253e52a1306e7801f66cecd7872fdae","observation_id":"b49141ee-4631-461b-80c3-27bddc050b50","resolution":{"observed_at":"2026-08-07T11:02:26.381434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19954","last_updated":"2024-06-28T14:40:03Z","snapshot_observed_at":"2026-07-06T18:38:29.579641Z","submitted_at":"2024-06-28T14:40:03Z","title":"BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19954","snapshot_observed_at":"2026-08-07T11:02:26.413735Z","title":"Bestow: Efficient and streamable speech language model with the best of two worlds in gpt and t5,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.413735Z"},"links":{"cited_paper":"/paper/2406.19954","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:5e989a1e842e46c449b59f430f2f76a7409aa9cb06d637721181cc59be9155a8","observation_id":"119599e9-2be7-47cb-9a49-5b9e0dc40092","resolution":{"observed_at":"2026-08-07T11:02:26.413735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:02:26.464939Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.464939Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:21425dea03e07b50b12d8474e0c7e9af4a343568340a9e796c49abdfcd3a251a","observation_id":"f17c0303-5cf2-49dc-a0c5-46f3466b5844","resolution":{"observed_at":"2026-08-07T11:02:26.464939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03752","last_updated":"2024-10-02T01:54:35Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-02T01:54:35Z","title":"Efficient Streaming LLM for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03752","snapshot_observed_at":"2026-08-07T11:02:26.495635Z","title":"Efficient streaming llm for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.495635Z"},"links":{"cited_paper":"/paper/2410.03752","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:d0590d3d914338fbb19a0c4d1d71374ffeb8b6d021a2c2140dc2faa4dfed39e0","observation_id":"1ee4d6ae-089e-4410-80bd-e67f089d5773","resolution":{"observed_at":"2026-08-07T11:02:26.495635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16107","last_updated":"2024-08-01T13:55:54Z","snapshot_observed_at":"2026-07-31T19:14:30.338485Z","submitted_at":"2024-06-23T13:50:08Z","title":"Decoder-only Architecture for Streaming End-to-end Speech Recognition","version":2},"cited_work":{"arxiv_id":"2406.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16107","snapshot_observed_at":"2026-08-07T11:02:26.631012Z","title":"Decoder-only Architecture for Streaming End-to-end Speech Recognition","venue":"eess.AS","work_id":"e781efc4-2a9f-4d70-be03-06791f2c01b7","year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.521767Z"},"links":{"cited_paper":"/paper/2406.16107","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:c52850b7da290588d4e7d1520dde829ef5b8d22b8d9069048709a6d2924f6653","observation_id":"a85ce056-a4a0-4df2-adae-bceb707f7f9b","resolution":{"observed_at":"2026-08-07T11:02:26.674736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":6},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.03722."}