{"as_of":"2026-08-14T09:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0a87215a2ecaeb19b8016d8d9c796fabb270e7540c7911aebf85f80778d657f","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:11:57.955428Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T22:16:51.917336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T22:21:53.649506Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"cited_work":{"arxiv_id":"2412.11272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11272","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient whisper on streaming speech","venue":null,"work_id":"f7fea834-8183-476a-83c9-abeb6cbe2741","year":2024},"citing_paper":{"arxiv_id":"2508.12301","last_updated":"2026-04-05T10:23:00Z","snapshot_observed_at":"2026-08-11T05:19:47.369517Z","submitted_at":"2025-08-17T09:32:40Z","title":"WhisperRT -- Turning Whisper into a Causal Streaming Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T22:16:51.917336Z"},"links":{"cited_paper":"/paper/2412.11272","citing_paper":"/paper/2508.12301"},"observation_digest":"sha256:a7492ac0d7bd7279fa0381bc213a7af54df5fcdb0a3e996ca3a8536b3f24c6b9","observation_id":"818eced5-2f8e-4812-9425-a9adefa861aa","resolution":{"observed_at":"2026-05-18T22:21:53.652242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"cited_work":{"arxiv_id":"2412.11272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11272","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient whisper on streaming speech","venue":null,"work_id":"f7fea834-8183-476a-83c9-abeb6cbe2741","year":2024},"citing_paper":{"arxiv_id":"2601.17097","last_updated":"2026-01-22T15:00:47Z","snapshot_observed_at":"2026-08-11T15:30:55.693592Z","submitted_at":"2026-01-22T15:00:47Z","title":"Sink or SWIM: Tackling Real-Time ASR at Scale","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T12:09:17.087477Z"},"links":{"cited_paper":"/paper/2412.11272","citing_paper":"/paper/2601.17097"},"observation_digest":"sha256:fe7d36a342bc8f3ccb8c7b150f77284cf64c693aa99195816441f06700ac01c1","observation_id":"4440a6c6-e16d-4a46-98e2-82eba009ed46","resolution":{"observed_at":"2026-05-16T12:10:53.532913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11272/citation-record","integrity":"/paper/2412.11272/integrity","json":"/paper/2412.11272/citation-record.json","paper":"/paper/2412.11272"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.931830Z","title":"Accessed: 2024-11-3","venue":null,"work_id":"2b432fbf-2541-4ffd-a03a-da205cd83bf1","year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.731021Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:58813741f5b1c9a01adb5069425ea3d304daa428503249959e93d8e8d4a91fd1","observation_id":"e1fee2c3-e370-41a2-9439-93222cf0253f","resolution":{"observed_at":"2026-08-11T15:11:58.936833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T15:11:57.735305Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.735305Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:a6198446a25afef2c7ea14b27666f376278102067547bd27e0573fc8a138418a","observation_id":"dc2052ab-9b74-4902-b738-bf19f9a44b52","resolution":{"observed_at":"2026-08-11T15:11:57.735305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00554","last_updated":"2018-01-02T05:24:30Z","snapshot_observed_at":"2026-07-06T06:16:50.245155Z","submitted_at":"2018-01-02T05:24:30Z","title":"Did you hear that? Adversarial Examples Against Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00554","snapshot_observed_at":"2026-08-11T15:11:57.738385Z","title":"Did you hear that? adversarial examples against automatic speech recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.738385Z"},"links":{"cited_paper":"/paper/1801.00554","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:d694cd7b9b7198f95984a6a98f022f62521c566635f37363c6289581223b7dc3","observation_id":"a17cf4bb-74a5-464f-ba1c-3fa280105781","resolution":{"observed_at":"2026-08-11T15:11:57.738385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.923415Z","title":"Apple macbook air tech specs, 2024","venue":null,"work_id":"7f0ec367-2ed2-4631-ad14-bbbd860312b1","year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.742310Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:0ba23d31045e61b02ee0d2982389c132274b233cd6e28ee239b0328d8a029299","observation_id":"30577563-e2bb-4df3-8748-a55b7caaaadf","resolution":{"observed_at":"2026-08-11T15:11:58.926431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-11T15:11:57.745362Z","title":"Neural machine trans- lation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.745362Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:86e16d39099ce68bb0df7e01a1d0fb3a26973accd4f701aed5af41c9a2c6c1bc","observation_id":"7ca7c6ef-9f0b-4613-9aee-f4876768af59","resolution":{"observed_at":"2026-08-11T15:11:57.745362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1975.11626","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.592546Z","title":null,"venue":null,"work_id":"d4b72990-97fa-4b99-b804-cb399ec18946","year":1975},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.748694Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:f1d6f8a4c03a3fd250837c0a75225d8bf414296e77cf4f1c4af91ca0493735f0","observation_id":"246f45ca-6e4b-40d1-b74b-08e9cbebf41d","resolution":{"observed_at":"2026-08-11T15:11:58.596857Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.751674Z","title":"A mathematical theory of adaptive control processes","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.751674Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:eeb07dd850bd2d9053409f6f11658158bdb9cc4f14389ab6ff2fa686b0e87a78","observation_id":"62593c14-0bf6-46d0-b9da-25d63e01403c","resolution":{"observed_at":"2026-08-11T15:11:57.751674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.910210Z","title":"Speech recognition for clinical documentation from 1990 to 2018: a systematic review","venue":null,"work_id":"27778f0c-5986-4ac8-a13a-2d63cab01ed3","year":1990},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.755262Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:53776757127bae3e2f6160da6e17fd476a60a6d42675d2c6303b39eebcbf813e","observation_id":"090f84b0-c612-4419-84ef-3452f7ae6132","resolution":{"observed_at":"2026-08-11T15:11:58.913193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.901746Z","title":"Language models are few-shot learners","venue":null,"work_id":"12cc5c63-3529-4940-8320-47424abae638","year":1901},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.757951Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:0704bd2acf5417bcdaa604286f6ebc9a2abd1f68a7c4eca186a06380bf27c3b2","observation_id":"494cbbb8-5a55-4348-8ca2-80fa349759ec","resolution":{"observed_at":"2026-08-11T15:11:58.905237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.893956Z","title":"Audio adversarial examples: Targeted attacks on speech-to-text","venue":null,"work_id":"2da16b54-9361-467b-b0f5-68e5c5bfd35c","year":2018},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.760645Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:cd3a2efaf046849397fbac6a536c78c9d4296eafed8016525c1581780631c606","observation_id":"094d6cd5-e6f3-48a0-adb3-52eb0e1797be","resolution":{"observed_at":"2026-08-11T15:11:58.896876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.886176Z","title":"https://github.com/corsix/amx, 2022","venue":null,"work_id":"e623d25e-73cc-4ad7-a4e1-c286d4fbc8e3","year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.763351Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:246b0bd3f916f65c067b634a21202930599b08e9f7d6a3b1ab010dc1b2e1876d","observation_id":"725460a3-7847-4591-949e-10a6cb67273c","resolution":{"observed_at":"2026-08-11T15:11:58.888962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.878327Z","title":"In 29th USENIX Security Symposium (USENIX Security 20) , pages 2667–2684, 2020","venue":null,"work_id":"789d8e1f-242d-486d-abe4-d06052ed71ed","year":2020},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.766015Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:c338bf4b34f0a6a6cf20e56155c041275db92c945df7da79f31faa95d2cd8497","observation_id":"3877e876-ef45-4874-afa7-83e9d4a5c606","resolution":{"observed_at":"2026-08-11T15:11:58.881328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.768592Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.768592Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:8ebad7c0c6204461972f31156370e056e69d8800603074982e7772e140fb5127","observation_id":"1e62c57e-2122-4f3f-a686-70b5754b17a6","resolution":{"observed_at":"2026-08-11T15:11:57.768592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.866727Z","title":"Automatic recognition of spoken digits","venue":null,"work_id":"427ffc47-86bc-497f-ad9b-25f6a7e983ab","year":1952},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.771062Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:1f9b87c9b95f1bf00daa0d18bf9e9215c526954d610d0db9de16a1f6ff56ae9d","observation_id":"50cbdccf-acf2-4b36-9cee-f03a241e06f0","resolution":{"observed_at":"2026-08-11T15:11:58.869693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.859297Z","title":"Bert: Pre- training of deep bidirectional transformers for language understanding","venue":null,"work_id":"77728d86-f94f-4a00-80f8-dd92032113cd","year":2019},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.774604Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:4557cf310f7f1e0099f9a2038f837f9932e5384dc832506f0147e8ba71376dd0","observation_id":"e23ba16d-0950-4668-a35b-636f32acc0eb","resolution":{"observed_at":"2026-08-11T15:11:58.862092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.850290Z","title":"Speculative decoding for 2x faster whisper inference, 2023","venue":null,"work_id":"ea592474-8704-41fc-835d-3448f19b4628","year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.777321Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:d1be7f7a11b150103d23f61a8b10968c844dc0849e97c742f42f22d839357755","observation_id":"2040508e-5056-4dd7-9985-87d990395ede","resolution":{"observed_at":"2026-08-11T15:11:58.854362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.842944Z","title":"ggerganov/llama.cpp, 2022","venue":null,"work_id":"f6944f8f-a0ac-4e88-a9b8-d2aa4c771203","year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.780439Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:aa9dad6272d840132c57983d930cafb0dbef221e463a7d4f14b001febffdb233","observation_id":"1ac83dde-2c25-45d3-b37c-06b8261f611e","resolution":{"observed_at":"2026-08-11T15:11:58.845564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.835410Z","title":"ggerganov/whisper.cpp, 2022","venue":null,"work_id":"eef20d43-c9cb-41f5-93c2-23efcd89e2ee","year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.783040Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:65f00ea81e7efb133c0498e90cd7f6cba0548ac75cf81cbcd2251ddb3197b889","observation_id":"26fb2ca9-a17f-4164-a9f1-041b2550ceb3","resolution":{"observed_at":"2026-08-11T15:11:58.838523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-12T19:51:35.721872Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-11T15:11:57.785464Z","title":"Sequence transduction with recurrent neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.785464Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:79d31565b959c8deb5fa1da0982d1a1962077217e876f133736b362cbe8bcb45","observation_id":"e82e09b5-dc9e-45b2-9b86-ac3f1a5d35df","resolution":{"observed_at":"2026-08-11T15:11:57.785464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-11T15:11:57.788464Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.788464Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:6b30e1c7ec1e77856b0c106d03059a60c932bd63398f3cfaa96731914041fc4b","observation_id":"468ba433-b7d5-4625-9837-42621a8a68e5","resolution":{"observed_at":"2026-08-11T15:11:57.788464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.826578Z","title":"MLX: Efficient and flexible machine learning on apple silicon, 2023","venue":null,"work_id":"2ec2f9b6-4681-43f9-bf6b-a42176037534","year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.791179Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:f68988fac7317889854eb5603c8178bf07de5d88114ae516aa3cb493e906cf9a","observation_id":"bef0cb85-d03c-4b74-af88-aaaacca45f7f","resolution":{"observed_at":"2026-08-11T15:11:58.829653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.818961Z","title":"Speech understanding systems: Summary of results of the five-year research effort, 1976","venue":null,"work_id":"30ba9f19-5947-4ed6-b04d-ba37f1af59cf","year":1976},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.793723Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:4b8664a2bae66c4b56d1c0cd559df4e41477588166799687130a38fd18e3f692","observation_id":"645054e9-16f2-4b42-9754-79d1b3eac5a9","resolution":{"observed_at":"2026-08-11T15:11:58.821807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.810524Z","title":"Streaming end-to-end speech recognition for mobile devices","venue":null,"work_id":"6b621f94-9640-4c2c-be13-5f079c93d980","year":2019},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.796197Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:1ae02d80cd47c3f136b41462f96b6ae4b74152e27f01e40c7d43764402c16bc1","observation_id":"20530a75-8258-4a5c-9c6a-e56172710f77","resolution":{"observed_at":"2026-08-11T15:11:58.814296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.802443Z","title":"Ted-lium 3: Twice as much data and corpus repartition for experiments on speaker adaptation","venue":null,"work_id":"8b2d3f9f-62ad-492f-8a84-45d1cb716326","year":2018},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.798672Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:6b1c1d108e130199eb91afc360a0e78cfbfd989f9a9b9ec337007548ff81c77e","observation_id":"2344ecb9-9d73-415c-a5be-0642d983e51b","resolution":{"observed_at":"2026-08-11T15:11:58.805651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02737","last_updated":"2017-06-08T19:30:02Z","snapshot_observed_at":"2026-08-13T01:35:21.240155Z","submitted_at":"2017-06-08T19:30:02Z","title":"Advances in Joint CTC-Attention based End-to-End Speech Recognition with a Deep CNN Encoder and RNN-LM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02737","snapshot_observed_at":"2026-08-11T15:11:57.801247Z","title":"Advances in joint ctc-attention based end-to-end speech recognition with a deep cnn encoder and rnn-lm","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.801247Z"},"links":{"cited_paper":"/paper/1706.02737","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:54604521ef20634cc89f1212f7df7ff4d8d412bdc24f0c08b378d490237c617d","observation_id":"c88a3b4b-3859-48d0-9a3c-40afca78a3ff","resolution":{"observed_at":"2026-08-11T15:11:57.801247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.804177Z","title":"Swapadvisor: Pushing deep learning beyond the gpu memory limit via smart swapping","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.804177Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:94f010a89285afb345a283415e7f03f93db8b05dd476fda13c5550f464257e97","observation_id":"e55ac934-d788-4dcf-988d-6884d4947301","resolution":{"observed_at":"2026-08-11T15:11:57.804177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.806689Z","title":"Deepum: Tensor migration and prefetching in unified memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.806689Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:d9fb1f2ddf116884b495e3e1387ccf5982c789bce21cb73e06f9a80dcee92f0c","observation_id":"9401c046-5b23-430e-af94-ab6774ffb69f","resolution":{"observed_at":"2026-08-11T15:11:57.806689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.794943Z","title":"Speech and language processing, 2000","venue":null,"work_id":"b00decc1-ae2c-4eb0-8938-a2cca9498cac","year":2000},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.809268Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:61cd10dc4d61db4a432eb51492cb7b0a75c340ed66ea07fbeb5a778c1c173979","observation_id":"091c9561-37b9-4a0e-90de-d888f886085b","resolution":{"observed_at":"2026-08-11T15:11:58.797821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05330","last_updated":"2019-09-11T19:46:21Z","snapshot_observed_at":"2026-08-12T15:12:00.828042Z","submitted_at":"2019-09-11T19:46:21Z","title":"Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05330","snapshot_observed_at":"2026-08-11T15:11:57.811984Z","title":"Large- scale multilingual speech recognition with a streaming end-to-end model","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.811984Z"},"links":{"cited_paper":"/paper/1909.05330","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:e218af8e947634129ad986a6b5f8c7c1af331e3b476c24c56832d8a5a45b966b","observation_id":"2a4a9b6a-28c3-4fe8-bff0-2a03ec80140a","resolution":{"observed_at":"2026-08-11T15:11:57.811984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T15:11:57.815931Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.815931Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:e7789c104ede6a73538dfe45f449fed4494db8093f9e4c14a4d34241b61a8d57","observation_id":"af25c6a9-e662-4d0c-b7ab-f308a048cb80","resolution":{"observed_at":"2026-08-11T15:11:57.815931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.786769Z","title":"Convolution-augmented parameter-efficient fine-tuning for speech recognition","venue":null,"work_id":"eab45343-b574-4261-a478-053a75d56a53","year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.819593Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:2eff9c867f67c3f88623056bf1b32b4c813f0cd9d65c80b895785779d6cc9655","observation_id":"a8b0faf0-90df-446a-9a85-f6e0d22b16b4","resolution":{"observed_at":"2026-08-11T15:11:58.789991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07863","last_updated":"2023-10-12T17:23:56Z","snapshot_observed_at":"2026-08-13T12:43:52.389685Z","submitted_at":"2023-02-15T18:55:29Z","title":"Speculative Decoding with Big Little Decoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07863","snapshot_observed_at":"2026-08-11T15:11:57.822034Z","title":"Mahoney, Amir Gholami, and Kurt Keutzer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.822034Z"},"links":{"cited_paper":"/paper/2302.07863","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:ae9851c26f3a689d72f1312b83d1309ac6524af95b207137ead45ea647e2ab74","observation_id":"8133820a-9a97-48b7-a7b1-341eb3ebde10","resolution":{"observed_at":"2026-08-11T15:11:57.822034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.778170Z","title":"Low-latency sequence-to- sequence speech recognition and translation by partial hypothesis selection","venue":null,"work_id":"7d9448b2-f25b-4e0d-ad91-9f8b413020b5","year":2020},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.825115Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:318313ffde8ea39c827a6c25a71969a7bc4a76377ff6606e99ea119cecdc3d5b","observation_id":"3cbfb0bb-9383-4450-a179-4372dfc16d32","resolution":{"observed_at":"2026-08-11T15:11:58.781953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14743","last_updated":"2023-09-21T09:41:17Z","snapshot_observed_at":"2026-08-13T10:47:00.599681Z","submitted_at":"2023-07-27T10:00:05Z","title":"Turning Whisper into Real-Time Transcription System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14743","snapshot_observed_at":"2026-08-11T15:11:57.828381Z","title":"Turning whisper into real-time transcription system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.828381Z"},"links":{"cited_paper":"/paper/2307.14743","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:ab15efe5497ee8976e53cd3b09db183ae429b2fa0bdfb685da0afe7435e71efa","observation_id":"c0e2a732-22d5-4cbc-95cf-eebe0733d498","resolution":{"observed_at":"2026-08-11T15:11:57.828381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.769634Z","title":"Streaming automatic speech recog- nition with the transformer model","venue":null,"work_id":"04a8ca0e-e847-4404-88fd-ee475b41e121","year":2020},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.831725Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:9eb123d16e9dece0590aa239f7ce26438ccb1793b6290541e6d2877ea1581025","observation_id":"e04c2db0-c5c3-4d73-96f9-8ca1ec3b96b6","resolution":{"observed_at":"2026-08-11T15:11:58.772640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03828","last_updated":"2019-08-15T05:15:43Z","snapshot_observed_at":"2026-08-01T00:27:10.219357Z","submitted_at":"2019-05-09T19:35:30Z","title":"Universal Adversarial Perturbations for Speech Recognition Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03828","snapshot_observed_at":"2026-08-11T15:11:57.834442Z","title":"Universal adversarial perturbations for speech recognition systems","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.834442Z"},"links":{"cited_paper":"/paper/1905.03828","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:fe3ce7c496be05d03411a2b4a668aa18aab31511ae6d1c7e795d4cd550083127","observation_id":"76335910-b08d-4256-9697-772306a91042","resolution":{"observed_at":"2026-08-11T15:11:57.834442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17316","last_updated":"2023-08-10T18:32:07Z","snapshot_observed_at":"2026-08-13T13:55:41.092132Z","submitted_at":"2022-10-26T21:03:17Z","title":"There is more than one kind of robustness: Fooling Whisper with adversarial examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17316","snapshot_observed_at":"2026-08-11T15:11:57.837979Z","title":"There is more than one kind of robustness: Fooling whisper with adversarial examples","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.837979Z"},"links":{"cited_paper":"/paper/2210.17316","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:b5e5a3dc74deadb5273ceeb358f2feec9d87af2eb4655de27782f197de29434a","observation_id":"00224c54-9fb2-4696-b3fd-d2add7375363","resolution":{"observed_at":"2026-08-11T15:11:57.837979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.761011Z","title":"Train- ing language models to follow instructions with human feedback","venue":null,"work_id":"eee6f844-3020-488f-a102-5a78338cd8b5","year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.841017Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:7133c98bdef77aa12764e9f5f81738a76ceb6e7dae5ae7af72dd14dc5c804826","observation_id":"b053425f-17b8-482c-aebc-27494d4481a5","resolution":{"observed_at":"2026-08-11T15:11:58.764019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.752307Z","title":"Lib- rispeech: an asr corpus based on public domain audio books","venue":null,"work_id":"77e48605-0b30-4c15-a039-d800d0cfa94a","year":2015},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.843498Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:59a58e240e8e278ce5b11408a543ccb99337255303de6d42e48a2799a0d1225a","observation_id":"f28c8d69-25ac-4a81-a9ed-dec47100c045","resolution":{"observed_at":"2026-08-11T15:11:58.756208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.846091Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.846091Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:80380d710391ca93714e6b597714f5cbad9d3e8102e6fe4f435a8edf03ada3f0","observation_id":"6b295caa-a991-45bb-a78a-0597aaed94e0","resolution":{"observed_at":"2026-08-11T15:11:57.846091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.739527Z","title":"Branchformer: Parallel mlp-attention architectures to capture local and global context for speech recognition and understanding","venue":null,"work_id":"d38b9975-7cb0-4361-adcc-c92c557dd3a6","year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.848604Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:8c858be00ac1222e35d27cfd323cb74d7e9209c6e406a4123f118394965e1be3","observation_id":"698b7f08-3809-4cb9-aba8-0c5b0a5ee70a","resolution":{"observed_at":"2026-08-11T15:11:58.742539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12654","last_updated":"2024-08-27T02:22:00Z","snapshot_observed_at":"2026-08-13T04:14:53.735819Z","submitted_at":"2024-02-20T02:04:38Z","title":"OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12654","snapshot_observed_at":"2026-08-11T15:11:57.851647Z","title":"Owsm-ctc: An open encoder-only speech foundation model for speech recognition, translation, and language identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.851647Z"},"links":{"cited_paper":"/paper/2402.12654","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:8db4f1466c8d5c7bc83b0e9f9ef37c7a8fc28a0b43a76c4654ecbe92b95779a3","observation_id":"b75de65d-c04d-42fb-9686-e1c49c643009","resolution":{"observed_at":"2026-08-11T15:11:57.851647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16658","last_updated":"2024-08-27T02:15:49Z","snapshot_observed_at":"2026-08-13T04:32:11.476011Z","submitted_at":"2024-01-30T01:22:18Z","title":"OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16658","snapshot_observed_at":"2026-08-11T15:11:57.855407Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.855407Z"},"links":{"cited_paper":"/paper/2401.16658","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:88d48560c4a5a3e024d71e972bc36e4ebc55f352f64eaab227dfa93a62f4704d","observation_id":"138f80b3-879a-439e-b263-28b3ba8a0e7f","resolution":{"observed_at":"2026-08-11T15:11:57.855407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.729689Z","title":"Reproducing whisper-style training using an open-source toolkit and publicly available data","venue":null,"work_id":"5559a623-9cb7-4974-ae6c-246a759d3a06","year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.858375Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:b16388cb8e03aa003d43abd9be3cb60cf4b82199e5e62595fb28e527f4c80b0e","observation_id":"98f7d38c-4830-41c1-913c-6c03fff58770","resolution":{"observed_at":"2026-08-11T15:11:58.733664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.721349Z","title":"Speech percep- tion at the interface of neurobiology and linguistics","venue":null,"work_id":"f90a989a-941e-4aee-9526-b66eb3601fbd","year":2008},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.860881Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:a95a4d144ddd3010e8f673e2a4da0930391d708c5a3546e330e35d6783eee71d","observation_id":"d94484bb-c132-4fd9-b332-6f766f875476","resolution":{"observed_at":"2026-08-11T15:11:58.724628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.863590Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.863590Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:a755b6e0efef9b9d394841a4cf97223134b7cc4a34be50a3f414dbf0796966a2","observation_id":"251e98f7-4a70-411e-b3c8-3de52bddfbf9","resolution":{"observed_at":"2026-08-11T15:11:57.863590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.866274Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.866274Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:541597458270741e3e7ca0dbb5d624a7bc83f1a6872a5646d5b6c4ccd2930863","observation_id":"6cb8518c-9b3a-4ebd-81fb-8dd3c92faf3f","resolution":{"observed_at":"2026-08-11T15:11:57.866274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.868942Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.868942Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:74d2ed600cb4f9f3d3298d68892c5b62b6d999baddc4246c022ae89869cdfd7b","observation_id":"af9b2efb-3254-4f00-91fc-7315dbf3a9db","resolution":{"observed_at":"2026-08-11T15:11:57.868942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04482","last_updated":"2024-10-11T17:21:40Z","snapshot_observed_at":"2026-08-13T20:54:27.852492Z","submitted_at":"2024-07-05T13:04:31Z","title":"Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04482","snapshot_observed_at":"2026-08-11T15:11:57.874444Z","title":"Controlling whisper: Universal acoustic adversarial attacks to control speech foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.874444Z"},"links":{"cited_paper":"/paper/2407.04482","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:4d63d51d300d3e914e658ea99fe5eb59e4f65faa200651c3a4b37aff77bec7f8","observation_id":"07330927-76d8-4dae-a04f-5db36bfcee3a","resolution":{"observed_at":"2026-08-11T15:11:57.874444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.877075Z","title":"Muting whisper: A universal acoustic adversarial attack on speech foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.877075Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:9414e88df4923811c57e9e9af809b4728aad2156efc1309cb62af451999f0e67","observation_id":"392bc3de-f999-4476-b06d-b3ef08c5a579","resolution":{"observed_at":"2026-08-11T15:11:57.877075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tlt.2013.21","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.979202Z","title":"Paul Robinson, and Bradley S","venue":null,"work_id":"aa9a55c1-b1bf-4193-bede-0c696c7346bb","year":2013},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.879758Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:9b4eedd282ebe279d3b4032ba4789727c3fea026c12f8d8c90ace7e412f256e9","observation_id":"006ed930-ce33-42b2-9c7b-ad34ce27e3dc","resolution":{"observed_at":"2026-08-11T15:11:57.982976Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.700522Z","title":"Exploring architectures, data and units for streaming end-to-end speech recognition with rnn-transducer","venue":null,"work_id":"4c463d9d-cdf5-420d-a43e-d6e6b1ca6b20","year":2017},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.882478Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:1fe5522530a0e224a06b0a41ede277ded2c219369a861ea9ff811487a081f2e9","observation_id":"c359b220-7008-4c8f-be90-4b7f55c4234c","resolution":{"observed_at":"2026-08-11T15:11:58.704061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.692408Z","title":"ZeRO-Offload: De- mocratizing Billion-Scale model training","venue":null,"work_id":"1f1e4923-150c-4792-8dc4-0f35c2939897","year":2021},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.885034Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:262665803776daec1fd385a605a2ad0f13f988b9bb9150bf0b0b6603c8419d66","observation_id":"93db44f8-3349-4a37-86e6-d80025cece7c","resolution":{"observed_at":"2026-08-11T15:11:58.695451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.684326Z","title":"Enhancing the ted-lium corpus with selected data for language modeling and more ted talks","venue":null,"work_id":"23322de9-d3e8-4e9d-a8ba-4c7bcd5867f1","year":2014},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.887689Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:5f82bd1247db45bbe329281ffb3247cd7d19759ea4f2b022fa76af08a95704d9","observation_id":"1a6f2e7e-3144-4ebd-98a7-85a1084640b2","resolution":{"observed_at":"2026-08-11T15:11:58.687304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05665","last_updated":"2018-10-30T12:02:07Z","snapshot_observed_at":"2026-07-06T06:56:02.159474Z","submitted_at":"2018-08-16T20:00:47Z","title":"Adversarial Attacks Against Automatic Speech Recognition Systems via Psychoacoustic Hiding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05665","snapshot_observed_at":"2026-08-11T15:11:57.890946Z","title":"Adversarial attacks against automatic speech recognition systems via psychoacoustic hiding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.890946Z"},"links":{"cited_paper":"/paper/1808.05665","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:d0bf4a154317113041cadfcbf347805fafc139ffb749b0230b6e8806f9365440","observation_id":"34169d80-0d54-47e2-a1af-2b5148244e3a","resolution":{"observed_at":"2026-08-11T15:11:57.890946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.676399Z","title":"Review of speech-to-text recognition technology for enhancing learning","venue":null,"work_id":"b62d5ea9-549e-4ecb-9f20-08e1c9ba55fe","year":2014},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.893794Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:698cf6d0a659ba910c453b4764bdd3e24f0caae69db5ab859a1da736d574e7f1","observation_id":"7eb371e8-3569-4b44-93e6-ce397c7d49fe","resolution":{"observed_at":"2026-08-11T15:11:58.679625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02207","last_updated":"2021-08-11T19:31:02Z","snapshot_observed_at":"2026-08-10T22:48:15.815007Z","submitted_at":"2021-04-06T00:55:11Z","title":"Dissecting User-Perceived Latency of On-Device E2E Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02207","snapshot_observed_at":"2026-08-11T15:11:57.896422Z","title":"Dissecting user-perceived latency of on-device e2e speech recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.896422Z"},"links":{"cited_paper":"/paper/2104.02207","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:3397702a15fc3b33166806848879a1d95d3bc0a1938d1c9a3dc682e06fb082be","observation_id":"ff1dba35-b561-490c-8c76-5ade1e72c3a1","resolution":{"observed_at":"2026-08-11T15:11:57.896422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12456","last_updated":"2024-12-12T12:38:12Z","snapshot_observed_at":"2026-08-13T05:00:32.918196Z","submitted_at":"2023-12-16T02:27:00Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12456","snapshot_observed_at":"2026-08-11T15:11:57.899379Z","title":"Powerinfer: Fast large lan- guage model serving with a consumer-grade gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.899379Z"},"links":{"cited_paper":"/paper/2312.12456","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:6d7a52a87e731e858f8fb32541d95d68bd138a07e0c5e849da7c1be83465e56f","observation_id":"ada30cfe-0565-4506-b4a1-d835bfc7a6b6","resolution":{"observed_at":"2026-08-11T15:11:57.899379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04970","last_updated":"2021-06-09T10:30:59Z","snapshot_observed_at":"2026-08-13T19:07:14.472178Z","submitted_at":"2021-06-09T10:30:59Z","title":"Instantaneous Grammatical Error Correction with Shallow Aggressive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04970","snapshot_observed_at":"2026-08-11T15:11:57.904845Z","title":"Instantaneous grammatical error correction with shallow aggressive decoding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.904845Z"},"links":{"cited_paper":"/paper/2106.04970","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:b196cc277f544e53e71129f69e859c14754d24e81948fd89dd332e9c38df46a3","observation_id":"b63a376d-5d78-4531-94ae-2497a4566db1","resolution":{"observed_at":"2026-08-11T15:11:57.904845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-11T15:11:57.907702Z","title":"Goodfellow, and Rob Fergus","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.907702Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:6e527951d659ceec1dda94883110ceccee4efa14783a7d558f24338249c71db2","observation_id":"73da8f7c-9092-44f6-8757-4afae33bd75c","resolution":{"observed_at":"2026-08-11T15:11:57.907702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.910917Z","title":"Streaming trans- former asr with blockwise synchronous beam search","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.910917Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:58294369e34e066bb004fc6a2b35ccd5cb4761e223c4618a84a8bd0c3b87bada","observation_id":"4fff794c-ac5e-42d5-b128-04ba5146e1a8","resolution":{"observed_at":"2026-08-11T15:11:57.910917Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.667849Z","title":"The calo meeting speech recognition and understanding system","venue":null,"work_id":"a393ba7c-6baf-4b79-952c-2238d59610a0","year":2008},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.913485Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:99effd3ec0734a63065cc52f538548c25b41f734245010716c13db1f941af15d","observation_id":"991113f4-2e3a-40c0-b0c3-38b0e68e9f90","resolution":{"observed_at":"2026-08-11T15:11:58.671050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.916319Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.916319Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:3573c55591567304e662947c1f135f54ad5e9d0297870db5194381df92509047","observation_id":"3dc58165-3aab-40f6-a3b2-0a83fc81a30f","resolution":{"observed_at":"2026-08-11T15:11:57.916319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10052","last_updated":"2024-06-14T14:07:26Z","snapshot_observed_at":"2026-08-12T23:42:39.773315Z","submitted_at":"2024-06-14T14:07:26Z","title":"Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10052","snapshot_observed_at":"2026-08-11T15:11:57.919068Z","title":"Simul- whisper: Attention-guided streaming whisper with truncation detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.919068Z"},"links":{"cited_paper":"/paper/2406.10052","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:f28f4be8473cdddba99cca689b15e2f070dbf7f7a045b53a59a041a558390375","observation_id":"d6fff2f0-5bbf-43a4-b963-9db803f49ac5","resolution":{"observed_at":"2026-08-11T15:11:57.919068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.921997Z","title":"Turbocharge speech understanding with pilot inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.921997Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:5aa75d17945db342444a9ff18a9de38ce224f2046e9a6029f27276ef2e7bf9f8","observation_id":"03387295-7265-473b-821a-24b96bc67d39","resolution":{"observed_at":"2026-08-11T15:11:57.921997Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.655647Z","title":"ESPnet: End-to- end speech processing toolkit","venue":null,"work_id":"a49ee2b3-4605-4dba-a979-9857bc7be67c","year":null},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.924604Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:76bea65b71e200ac67b17f0da7d6ffcbf9dd94ca9bda486a71855a0d6449ceed","observation_id":"03455b10-86cd-4b1a-ad0f-9a48a940dd5f","resolution":{"observed_at":"2026-08-11T15:11:58.658540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.647010Z","title":"Loongserve: Efficiently serving long-context large language models with elastic sequence parallelism","venue":null,"work_id":"3d2e181d-e090-4fb1-85be-33a4b06c46ea","year":null},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.930867Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:4a7cc6301bc8505fc14359dd5c66563dd6a448de384e38608c03d9daab0a7807","observation_id":"42c84d03-9e8b-4e7b-a97f-b066a9915e7a","resolution":{"observed_at":"2026-08-11T15:11:58.649972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16487","last_updated":"2023-10-30T01:36:06Z","snapshot_observed_at":"2026-08-13T16:12:20.662382Z","submitted_at":"2022-03-30T17:27:09Z","title":"Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16487","snapshot_observed_at":"2026-08-11T15:11:57.936653Z","title":"Lossless speedup of au- toregressive translation with generalized aggressive decoding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.936653Z"},"links":{"cited_paper":"/paper/2203.16487","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:e8b8a1b1dfd4a12e19224e1feae1ff7d51bfb0f6728661b07d88d60ccb1f123c","observation_id":"f28cfe96-0ce5-4b57-be1b-aa55c22217d2","resolution":{"observed_at":"2026-08-11T15:11:57.936653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.638356Z","title":"Toward human parity in con- versational speech recognition","venue":null,"work_id":"80dcc3db-4d8f-4d93-8b89-e983f8ac7314","year":2017},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.940291Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:b148a98dc7e44b3a4a132a749066b412a9d447bef25da3b7fc594da764316e68","observation_id":"5a5b0c0d-2af8-4d98-8484-c827f9c37b3f","resolution":{"observed_at":"2026-08-11T15:11:58.641768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05858","last_updated":"2024-12-15T15:26:41Z","snapshot_observed_at":"2026-08-13T20:46:02.494744Z","submitted_at":"2024-07-08T12:20:45Z","title":"Fast On-device LLM Inference with NPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05858","snapshot_observed_at":"2026-08-11T15:11:57.943619Z","title":"Empowering 1000 tokens/second on-device llm prefilling with mllm-npu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.943619Z"},"links":{"cited_paper":"/paper/2407.05858","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:570507591e9e874ad0e799bc094964e3f0c12d81bfb3599c211df4b9e1f89891","observation_id":"0f39021f-fe3e-452b-af6b-d3d1fd2dd17c","resolution":{"observed_at":"2026-08-11T15:11:57.943619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04487","last_updated":"2023-04-10T09:55:14Z","snapshot_observed_at":"2026-08-13T12:05:48.249981Z","submitted_at":"2023-04-10T09:55:14Z","title":"Inference with Reference: Lossless Acceleration of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04487","snapshot_observed_at":"2026-08-11T15:11:57.946433Z","title":"Inference with reference: Lossless acceleration of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.946433Z"},"links":{"cited_paper":"/paper/2304.04487","citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:0e819bcb4f4267419d30152824336557ec2f4212360d39bebb8972c17d5d9441","observation_id":"ad35efc5-74ed-4041-9ed5-32b43527ef68","resolution":{"observed_at":"2026-08-11T15:11:57.946433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.949322Z","title":"Transformer transducer: A streamable speech recog- nition model with transformer encoders and rnn-t loss","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.949322Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:71140ccb9134d8e95c39336cbdc6f9aec41902695b27f3c6d1df09c9beaf59c1","observation_id":"ad388ebc-0738-4f51-a6b9-13e26e4f2cbe","resolution":{"observed_at":"2026-08-11T15:11:57.949322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.629733Z","title":"Black-box adversarial attacks on commercial speech platforms with minimal information","venue":null,"work_id":"9b0fdb6e-566b-4555-9832-42278c7f05dd","year":2021},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.951868Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:b267efb9f08353a27d32c080a2ee239cecfb321bce9245fe58b25b1d3ba3d5f2","observation_id":"25c14384-0ad6-4aa9-bafd-b20256e9b58d","resolution":{"observed_at":"2026-08-11T15:11:58.633008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:58.620603Z","title":"In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24) , pages 193–210, 2024","venue":null,"work_id":"7df5e39c-a7e7-48e8-bfad-1bc04870f34d","year":2024},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.955428Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:1746ca4b29a25172cf4f4f41f1294f49ee7ffd59806e1893064dce5c15cf9814","observation_id":"85c56d45-b835-4286-8d99-be546aa2d969","resolution":{"observed_at":"2026-08-11T15:11:58.624249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.927426Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.927426Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:4eb41c620bed7f3cee0414664c0c007714b19939ba52db808e7d04a6811ab1c1","observation_id":"6a3efb1f-8404-416b-9c99-cd82ef5f4442","resolution":{"observed_at":"2026-08-11T15:11:57.927426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:11:57.933707Z","title":"doi:10.1145/3694715.3695948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:11:57.933707Z"},"links":{"citing_paper":"/paper/2412.11272"},"observation_digest":"sha256:6ff53f5549bcbcd2d412612ad572379ba10c2e998ad41f1b4424fd9920703439","observation_id":"d164851d-0a5a-4698-92eb-9e96d9578ee8","resolution":{"observed_at":"2026-08-11T15:11:57.933707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11272","last_updated":"2025-04-21T19:26:09Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T03:23:31.562792Z","submitted_at":"2024-12-15T18:27:37Z","title":"WhisperFlow: speech foundation models in real time"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 2 inbound Pith citation observations for arXiv:2412.11272."}