{"as_of":"2026-08-08T01:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb957444e2a50edda991ef17326ab29ff83efc4fc6c793e033623a4fc4d4fe95","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:07:25.099655Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:07:23.619613Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T01:07:25.289026Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"cited_work":{"arxiv_id":"2506.12154","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12154","snapshot_observed_at":"2026-08-07T01:07:25.289026Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","venue":"cs.SD","work_id":"67f894fc-31d9-4874-9f2a-6f8859795b19","year":2025},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.619613Z"},"links":{"cited_paper":"/paper/2506.12154","citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:016f61339b6c742fc5a3f2653b643845130af6d018fb7d2eb73ada6d7b7077c7","observation_id":"ca1e33d6-9bd4-42c1-93e6-b6fbe6232ffe","resolution":{"observed_at":"2026-08-07T01:07:25.341384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12154/citation-record","integrity":"/paper/2506.12154/integrity","json":"/paper/2506.12154/citation-record.json","paper":"/paper/2506.12154"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.496469Z","title":"Whisper [1], released by OpenAI, exemplifies this trend","venue":null,"work_id":"00ef89c4-9874-4dd3-b4dd-9c9876e3c509","year":null},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.553893Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:ae9b53eed111aa5824115f5a0f25a83a6a5c604ed5f450df34330a94a1927b11","observation_id":"4ac91c61-097d-4b65-bf6b-7fdf5d0c6e73","resolution":{"observed_at":"2026-08-07T01:07:27.501454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"cited_work":{"arxiv_id":"2506.12154","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12154","snapshot_observed_at":"2026-08-07T01:07:25.289026Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","venue":"cs.SD","work_id":"67f894fc-31d9-4874-9f2a-6f8859795b19","year":2025},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.619613Z"},"links":{"cited_paper":"/paper/2506.12154","citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:016f61339b6c742fc5a3f2653b643845130af6d018fb7d2eb73ada6d7b7077c7","observation_id":"ca1e33d6-9bd4-42c1-93e6-b6fbe6232ffe","resolution":{"observed_at":"2026-08-07T01:07:25.341384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.479906Z","title":"We also considered Earnings-22 [16], but excluded it due to its lim- ited size, which is insufficient for training required by the ex- periments","venue":null,"work_id":"71b6357a-dc5d-4187-860f-a89c556c4b67","year":2023},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.671326Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:7331311ab99721078a1bb7441f238af349c45c58db61d35c7b9576def305c4ab","observation_id":"cb3484ec-5e6a-46bf-9f9c-13af8f5f6a02","resolution":{"observed_at":"2026-08-07T01:07:27.485037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.462434Z","title":"$1.3 million","venue":null,"work_id":"b6e99317-1795-475d-b671-74c7d83ea282","year":1935},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.736169Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:4ca94abee681dd3fa0cccbae3042e6bc61369f7ce70e7cac4d6ed95371d5ac46","observation_id":"2bc45b24-e59c-4b40-bdbb-af6e3693695f","resolution":{"observed_at":"2026-08-07T01:07:27.467225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.446151Z","title":"We intro- duced a hybrid tokenizer to improve generalization, especially when fine-tuning is performed with limited data","venue":null,"work_id":"aced752d-f8e1-49e3-8123-127a6827bfa5","year":null},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.805663Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:513f014f7351ead241e29caa2d0c6ed75d2cdbbf0154272ebed5629a812c4d71","observation_id":"37af1c70-e9d8-4370-92fb-071e1224f2e4","resolution":{"observed_at":"2026-08-07T01:07:27.450773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.429210Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"4babd0c0-c703-4dfb-b5f2-50f3c081d4d0","year":2023},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.871889Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:5a50a42247aef58d11a68fbe6955a2a5bf9efab97cb59b95635752fd720da2b1","observation_id":"c0cfde51-a754-4468-bedb-2bb38f4fc313","resolution":{"observed_at":"2026-08-07T01:07:27.435203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.410770Z","title":"Turning whisper into real- time transcription system,","venue":null,"work_id":"cdbf47bd-2b64-4074-b661-1195383dc230","year":2023},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.933963Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:985c2a6ada3f0d6dccdb2afe9a8d3b854b3a8d7225a9be6ae2221e9a742a32bd","observation_id":"ad42da0d-2c0e-4722-bc13-c88c193411c7","resolution":{"observed_at":"2026-08-07T01:07:27.416034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.393964Z","title":"Simul-whisper: Attention-guided streaming whisper with truncation detection,","venue":null,"work_id":"ca17d738-6b48-4302-962f-c410466861b6","year":2024},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:23.999076Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:67ff5896c79fc96d8834e15767f731b060dc423a981349302c42d6b76e9733b5","observation_id":"5dc41039-d442-4dfc-a5d1-37b9ca75ecb3","resolution":{"observed_at":"2026-08-07T01:07:27.399148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.377273Z","title":"Con- nectionist temporal classification: labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":"09f9748c-0817-4fc9-aa5d-ef16ca52db8f","year":2006},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.066277Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:2157e035027223e0e51b0df322074d35384d52d5aba51ee14945d71e03d0715e","observation_id":"36614f02-218a-4b57-a810-26350fb5315d","resolution":{"observed_at":"2026-08-07T01:07:27.382396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:27.209674Z","title":"Sequence transduction with recurrent neural net- works,","venue":null,"work_id":"fe989423-7fe4-4fa8-b0b5-3c75bd51a353","year":2012},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.132653Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:500416cba4dddffbfd350143466b26b9c41bf1be0dd244031e0bf98532e4310b","observation_id":"f7ebb03e-e715-48f1-b575-1b1185d539e9","resolution":{"observed_at":"2026-08-07T01:07:27.362807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05481","last_updated":"2021-12-29T10:38:00Z","snapshot_observed_at":"2026-07-06T10:22:25.341862Z","submitted_at":"2020-12-10T06:54:54Z","title":"Unified Streaming and Non-streaming Two-pass End-to-end Model for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05481","snapshot_observed_at":"2026-08-07T01:07:24.172626Z","title":"Unified streaming and non-streaming two- pass end-to-end model for speech recognition,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.172626Z"},"links":{"cited_paper":"/paper/2012.05481","citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:78afc4e1846bbdfe7f610ba36d9775b3047ccc86db75d72537d70100689e46cf","observation_id":"e798313b-24dc-4d09-bfe5-56d522e7283b","resolution":{"observed_at":"2026-08-07T01:07:24.172626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:26.886545Z","title":"Wenet: Production oriented streaming and non-streaming end-to-end speech recognition toolkit,","venue":null,"work_id":"0ed9e97e-9aac-4b5f-822d-755902d3234e","year":2021},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.242363Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:d84fb6148f1aae43f23cadcf3e11a5064a58ea88e0a6307aec5e5262db2d6bbe","observation_id":"1cbdc094-966d-42ce-8ce1-9ddf74d3d91d","resolution":{"observed_at":"2026-08-07T01:07:27.041215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:26.657542Z","title":"Wenet 2.0: More productive end- to-end speech recognition toolkit,","venue":null,"work_id":"47a1a1fc-1827-45a1-8071-1c5bd14b53fd","year":2022},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.324384Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:cde4fda2149a85e383500315a92d1304b7430c8ead4792c442da9a7cc3bfa947","observation_id":"0972ce04-7659-4248-9178-9395c31c8d08","resolution":{"observed_at":"2026-08-07T01:07:26.767482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:26.426544Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":"061e90d4-24fe-413d-853b-2736cf39a795","year":2016},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.474118Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:0b9a074c7d4f8d01d28e9196860fe4a91bc7771b28da67c36e496220a274a21f","observation_id":"a0ca50c7-6981-499a-a693-009c1d3c72ad","resolution":{"observed_at":"2026-08-07T01:07:26.571849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:26.221119Z","title":"Hy- brid ctc/attention architecture for end-to-end speech recognition,","venue":null,"work_id":"8738071a-8f0e-4d04-8732-5eea8cfabece","year":2017},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.560953Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:d38e91b71030afcb41d74847584737851e0c7930442f862df3afd4499b9a0a3b","observation_id":"34ed571d-a5d4-425b-a286-00a1a555a31b","resolution":{"observed_at":"2026-08-07T01:07:26.325589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:24.687921Z","title":"A new algorithm for data compression,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.687921Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:f631ac267a3d03eccead2710a00ca537e91b971a3e74139b2db3ced77b5702f0","observation_id":"bb5c193f-16bd-449b-906e-f8e59c2449f7","resolution":{"observed_at":"2026-08-07T01:07:24.687921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:25.971456Z","title":"Language models are unsupervised multitask learn- ers,","venue":null,"work_id":"6d63f600-940d-4a7f-b1d2-b74ee05e21b2","year":2019},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.695228Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:e8dec11e4e003cb6e43b79fb0c1b58f950e0aaaa32015b09ec0b33d4223edbe0","observation_id":"0cbb3f2d-2aa3-49e8-acaa-8405047703a8","resolution":{"observed_at":"2026-08-07T01:07:26.070765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-07T01:07:24.815381Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.815381Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:3a88487c4fb85eb7a433d7ee106675af4b2d962a8e3f94dae18b425ac49fc29c","observation_id":"cc6d7787-00e2-43c1-a57d-5325981190f2","resolution":{"observed_at":"2026-08-07T01:07:24.815381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:25.772345Z","title":"PyTorch 2: Faster Machine Learning Through Dynamic Python Bytecode Transformation and Graph Compilation,","venue":null,"work_id":"660b632d-46b9-4241-8dcd-e0bc99bb2a99","year":2024},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.919589Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:12a60f521ff2101505e1c65b2dba6f5606cc1b94966de26ae7211fd12f969e52","observation_id":"1e1a8f9a-19c2-4b18-85ca-ec57da7d44d8","resolution":{"observed_at":"2026-08-07T01:07:25.891366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:07:25.445950Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"d6359e4e-6ef7-4549-8647-cbcde8064b1f","year":2015},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:24.997475Z"},"links":{"citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:6238485d602b64b99117f4297646280d497aa2b657df397cb77a9e9a5043c578","observation_id":"aba90d9b-2c1d-438c-bc3b-32d36ca27b37","resolution":{"observed_at":"2026-08-07T01:07:25.645845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15591","last_updated":"2022-03-29T14:02:57Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T14:02:57Z","title":"Earnings-22: A Practical Benchmark for Accents in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15591","snapshot_observed_at":"2026-08-07T01:07:25.099655Z","title":"Earnings-22: A practical benchmark for accents in the wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T01:07:25.099655Z"},"links":{"cited_paper":"/paper/2203.15591","citing_paper":"/paper/2506.12154"},"observation_digest":"sha256:ed0a823205b7f70427c35ceeeb9bd682013688d97cf9c7edfbcd0171f7af799c","observation_id":"93dc0f56-3c94-4a0f-abbd-4311cbcc27ba","resolution":{"observed_at":"2026-08-07T01:07:25.099655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12154","last_updated":"2025-06-13T18:19:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T21:16:47.650626Z","submitted_at":"2025-06-13T18:19:09Z","title":"Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2506.12154."}