{"as_of":"2026-08-12T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3df7c7b4cd04cbaa4954e75aeb41db188d314103f93fd90b778aa514cb9dfb0d","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:18:01.876712Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.02370/citation-record","integrity":"/paper/2501.02370/integrity","json":"/paper/2501.02370/citation-record.json","paper":"/paper/2501.02370"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.448832Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.448832Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:1ee35bf099b1a9f24c20d25bd333d5bb253f4e043c7715ac09fe5652c7b1c757","observation_id":"0f3b9c67-05fa-4f7a-8bf9-5a49f7184a13","resolution":{"observed_at":"2026-08-10T22:18:01.448832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.455015Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.455015Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:3c1ecd510b1504aa82163f75b29f683d56b932767bf749a28ef7b09b10775f25","observation_id":"e6c487ac-5620-44b7-8e09-33629c904bcd","resolution":{"observed_at":"2026-08-10T22:18:01.455015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.461178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.461178Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:9b23eadd5fad5e0de893e6793287d4f71f1b4b4f3cb4fe9cb73b21d6c7e433a8","observation_id":"0b4a17ef-b74b-4526-98e5-a84dd5879d8e","resolution":{"observed_at":"2026-08-10T22:18:01.461178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-08-09T22:54:40.370971Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-08-10T22:18:01.466667Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.466667Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:1b5f99ab924d6df8e0f29c5c1f2e04256c847aba87cf46682300821b1f5c1e6e","observation_id":"c5fb2eb8-c6ac-495a-b8c4-797fc17f1434","resolution":{"observed_at":"2026-08-10T22:18:01.466667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.513229Z","title":null,"venue":null,"work_id":"42422641-7f88-450b-aad6-8eb4df240204","year":2017},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.472850Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:d6992dd4eacda80d301b9faf5a9aabf074034eb23cae6f863125a5886fbc5bb8","observation_id":"00681776-ef60-4a60-8c94-5e2a3a3247d6","resolution":{"observed_at":"2026-08-10T22:18:03.519305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-10T22:18:01.478377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.478377Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:dab8fda569e877dda0d855036c37eef2bc0734bdc59ad52a572fa32c8bfba299","observation_id":"2cbddd3e-636f-447e-9c0b-2b184ddb2405","resolution":{"observed_at":"2026-08-10T22:18:01.478377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.495615Z","title":null,"venue":null,"work_id":"05f12280-e61a-43ab-ba31-a5260f91242b","year":2018},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.484075Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:ae78475fc3deaaf88be54d12c6769e76cd6057b7111dfcff88f42b0bcedc5532","observation_id":"2a26895a-ffd2-4510-8ed0-23822735c55b","resolution":{"observed_at":"2026-08-10T22:18:03.500520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01744","last_updated":"2016-12-06T10:48:56Z","snapshot_observed_at":"2026-08-08T03:00:23.406003Z","submitted_at":"2016-12-06T10:48:56Z","title":"Listen and Translate: A Proof of Concept for End-to-End Speech-to-Text Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01744","snapshot_observed_at":"2026-08-10T22:18:01.489299Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.489299Z"},"links":{"cited_paper":"/paper/1612.01744","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:e0c9c9e7d4bdf07af25980c744c022c93669c4dfad1726d7152b3f0b8c92e4d0","observation_id":"9d04f292-3889-4c34-8ced-6301b562e8fd","resolution":{"observed_at":"2026-08-10T22:18:01.489299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T22:18:01.495695Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.495695Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:1ac1f87844e0c37efd1e7463f4ecd391f88334108e8eaf280d63df596aba65dc","observation_id":"74368e12-e5ec-4696-8e83-edd0f44976db","resolution":{"observed_at":"2026-08-10T22:18:01.495695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.500795Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.500795Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:9b288d6f60d88837c1337a61e86608bca77f34bbf4b0c1f68b188423e908b862","observation_id":"98577954-92cd-496f-af45-0363a881fa0d","resolution":{"observed_at":"2026-08-10T22:18:01.500795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.01211","last_updated":"2015-08-20T00:38:43Z","snapshot_observed_at":"2026-08-08T05:51:42.766537Z","submitted_at":"2015-08-05T20:17:58Z","title":"Listen, Attend and Spell","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.01211","snapshot_observed_at":"2026-08-10T22:18:01.505886Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.505886Z"},"links":{"cited_paper":"/paper/1508.01211","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:69836c98c500ca60f8f804e8d15eebbb0fa088a6235f543cc357eac58ded3c9e","observation_id":"c57b96bd-cf23-4998-bd38-e087f706bb27","resolution":{"observed_at":"2026-08-10T22:18:01.505886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-10T22:18:01.511482Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.511482Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:cebf2b351d7daf45859c14a762a8bf3aab465ff3f6b9a1e646e9628a85801110","observation_id":"97e5cbe5-2c95-4895-86a2-30664262a0a3","resolution":{"observed_at":"2026-08-10T22:18:01.511482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.416","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.291186Z","title":null,"venue":null,"work_id":"7df82ff6-1a0d-4309-b1d0-0032e16e70b7","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.517081Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5f8c22c50a5851ff913a1625486fd073073f54426c419ad5a951bffd8c617d31","observation_id":"307c7a12-9d78-4dda-8972-ec0762f8bffb","resolution":{"observed_at":"2026-08-10T22:18:02.297511Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.479247Z","title":null,"venue":null,"work_id":"aa0104c3-6cb5-44fe-9390-7633af10f656","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.522137Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:ee819c29d0a11db0f7639c179dc9c95e9fc1d65ddf75e8a5222140d808bf040a","observation_id":"1969d1a8-c8df-4690-8436-94d3999077bb","resolution":{"observed_at":"2026-08-10T22:18:03.484626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19954","last_updated":"2024-06-28T14:40:03Z","snapshot_observed_at":"2026-07-06T18:38:29.579641Z","submitted_at":"2024-06-28T14:40:03Z","title":"BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19954","snapshot_observed_at":"2026-08-10T22:18:01.526989Z","title":"Puvvada, Nithin Rao Koluguri, Piotr Żelasko, Jagadeesh Balam, and Boris Ginsburg","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.526989Z"},"links":{"cited_paper":"/paper/2406.19954","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:f78c2a0768284ee28818ddec49dd13e86e341ddb81973f6048dfa08bc73fda32","observation_id":"1880c362-05f2-4d71-a28b-ff22d270cc57","resolution":{"observed_at":"2026-08-10T22:18:01.526989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T22:18:01.532170Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.532170Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:7f4c6ad54b879c628391c462fe5d62e4ae361fc302716624e3db3e80cbf06d52","observation_id":"72d40374-923b-48ca-8cad-cc33ea7bb60c","resolution":{"observed_at":"2026-08-10T22:18:01.532170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-10T22:18:01.537186Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.537186Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5eea784c62182bbd7ee176b03fc98a098453ebaf422172b8ba067b7663d6f86e","observation_id":"a02aebfe-1914-42a6-af68-14ac5762e034","resolution":{"observed_at":"2026-08-10T22:18:01.537186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.542521Z","title":"Di Gangi, Roldano Cattoni, Luisa Bentivogli, Matteo Negri, and Marco Turchi","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.542521Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:bd747ef5f916ebeb13c4982c61ca3a17b4c4033dbcce822cb98905c71f52a22b","observation_id":"f0674089-193f-4071-9c26-11a92076e2ae","resolution":{"observed_at":"2026-08-10T22:18:01.542521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.461523Z","title":null,"venue":null,"work_id":"b304b628-1bdd-4c41-ae9e-24f2be533d9e","year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.547880Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:998a97c0c46490762d6acabaa9af17d23afa1f7a40bc09a801171ab0a9435ff2","observation_id":"ff73b565-cb79-408f-973b-3990f54efd73","resolution":{"observed_at":"2026-08-10T22:18:03.467338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.553570Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.553570Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:e816ff9b5ce7fabec536f063345a07d4457b754fd449891f2dd5fdbc1b9e531d","observation_id":"4f598268-324a-4286-8dd8-5d40c1c8453a","resolution":{"observed_at":"2026-08-10T22:18:01.553570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.445156Z","title":null,"venue":null,"work_id":"2a285c94-f352-4757-9837-e9efbd2b88ac","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.558447Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:366653aa997dfac3813a1b013a5b3735399b0cb34674f3136d43fb82ec18b831","observation_id":"63aed7e9-80d5-461c-85a1-03212c2050dd","resolution":{"observed_at":"2026-08-10T22:18:03.450486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.563366Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.563366Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5791dcac85ab44c4fdff0095ffe2a5306f839b6c97b4001a0cb47e8981544c96","observation_id":"b1c261b1-4c9d-4a98-a3ba-f6ff39dbf4ae","resolution":{"observed_at":"2026-08-10T22:18:01.563366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.iwslt-1.13","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.207939Z","title":null,"venue":null,"work_id":"f555ee6b-443b-4633-9c80-e9857239cfef","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.568325Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:f74ab88ed9ca25a9548b46e291a5139d481cb557725cfa1cbf6694f6b88ecef4","observation_id":"5434c9e8-0a74-4150-b062-866bcce2a019","resolution":{"observed_at":"2026-08-10T22:18:02.216980Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.574114Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.574114Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:efb78b67059372d7d78a10d14f4b03eb4da53ef90dd01e76771d7482a86a6b9c","observation_id":"19cf8ee4-d37b-4e0e-9258-6277cd896d8e","resolution":{"observed_at":"2026-08-10T22:18:01.574114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.579165Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.579165Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:15f8a828f367218ec193cdd74f94f018ba50eb3350281eef2b797743eb819cbf","observation_id":"244d2d17-71da-4dfa-a609-1ebf6f162b4c","resolution":{"observed_at":"2026-08-10T22:18:01.579165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.584589Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.584589Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:96dd9ff20d51d2aa0b1e9cda6aff11446c365bcf4ca8f92c0d559f1aef2a8d4e","observation_id":"f8cd1f14-14f0-4fc8-928e-f052921a25ff","resolution":{"observed_at":"2026-08-10T22:18:01.584589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-565","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.150018Z","title":null,"venue":null,"work_id":"2c40bab0-7617-414a-91d6-e315f126c66a","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.589891Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:6d9a54ac945ee10aa9af95afa0ba3fa625a3dc18bc00d10e149c6eb081276b7e","observation_id":"6da82df2-b3aa-46bb-91c9-5b3008b8003f","resolution":{"observed_at":"2026-08-10T22:18:02.157931Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.787","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.125516Z","title":null,"venue":null,"work_id":"98ca46f4-c973-4878-8a59-264894bc233e","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.594610Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:91065c0a6b91138aac0f99c28b8b5d548d8983a745f4d951b7a6da4a52fa2ef4","observation_id":"e0f6b5d2-e2d3-495f-b902-18f169f5a594","resolution":{"observed_at":"2026-08-10T22:18:02.131824Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-11T23:45:23.450183Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T22:18:01.599424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.599424Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:ead6b6d9b063813832f12d545fdc265f182cc1ae64a21d11e70e58518b5c3c28","observation_id":"df371e8f-507e-43ae-8b4e-3424983f3466","resolution":{"observed_at":"2026-08-10T22:18:01.599424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03169","last_updated":"2024-07-03T14:42:49Z","snapshot_observed_at":"2026-07-06T18:41:01.720889Z","submitted_at":"2024-07-03T14:42:49Z","title":"Investigating Decoder-only Large Language Models for Speech-to-text Translation","version":1},"cited_work":{"arxiv_id":"2407.03169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03169","snapshot_observed_at":"2026-08-10T22:18:02.932112Z","title":"Investigating Decoder-only Large Language Models for Speech-to-text Translation","venue":"cs.CL","work_id":"474654db-1f62-4d26-a23f-df195ab7b443","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.604423Z"},"links":{"cited_paper":"/paper/2407.03169","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:9903cbb56a87d12c0d2347cc4ba698ae55cce41e172d3b61bfc918e673bff210","observation_id":"92e0aa0a-c532-4b8b-b187-eb395f6f779d","resolution":{"observed_at":"2026-08-10T22:18:02.937954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.419347Z","title":null,"venue":null,"work_id":"308f32aa-a57e-4fc2-a197-ef5a83d80eef","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.609511Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:1ecd26ebea4762491126a4e3f5329082bd0da2ebfde06bae3bef7565d8ceabcf","observation_id":"4e97a6a2-584e-4b67-b218-fafbb27dba81","resolution":{"observed_at":"2026-08-10T22:18:03.424437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.naacl-main.150","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.100760Z","title":null,"venue":null,"work_id":"53df0fa8-c46a-4d32-a397-b6e54f397b6f","year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.615827Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:accd7f8362ab4a3d3d37e58b39ab31e193c774958bb47f83f98757529665434e","observation_id":"8c847965-af42-4aef-bb62-18c628730887","resolution":{"observed_at":"2026-08-10T22:18:02.106711Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T22:18:01.621418Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.621418Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:0b71697364d0e79af4d8885be16a1a224d68c8c3b5531bf826574d45c7aeabce","observation_id":"ae5c7f6d-a245-4092-b0d6-ece5797f5c75","resolution":{"observed_at":"2026-08-10T22:18:01.621418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.626619Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.626619Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:a741d628089e0ef453babd73e76e9f4e55cdbc98397d47a25e82aa929e798b4c","observation_id":"7856850b-884c-4fc6-8192-6dbbb2df1237","resolution":{"observed_at":"2026-08-10T22:18:01.626619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.632173Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.632173Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:e7fdc940c854b1933bd3013ff22d65ae91f981dbc5cdc721d30d7c0f892d4a9d","observation_id":"fcca62ab-ab44-41ce-843d-d24e3073b5a5","resolution":{"observed_at":"2026-08-10T22:18:01.632173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.637237Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.637237Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:64e1b89aa3623dbb3f3818a529137ac23da1e2f42555b159d8f60e115c78b2a3","observation_id":"3b01ca19-9c4c-40e5-80de-73d21c0b79b1","resolution":{"observed_at":"2026-08-10T22:18:01.637237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.643157Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.643157Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5ab885fa0123eb4c1bd80eb68d496b28e613b5fe951cfc79c305033c440d2ef5","observation_id":"8616c69c-db18-47df-aa44-57a6322e35ae","resolution":{"observed_at":"2026-08-10T22:18:01.643157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.648424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.648424Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:2c10e1de5d9824490dfeecbe7e903eb9ac10aa50c02345c358a196781a4ca6f4","observation_id":"d8ec79a6-45d1-4b9c-b645-645dca211bcf","resolution":{"observed_at":"2026-08-10T22:18:01.648424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.376500Z","title":null,"venue":null,"work_id":"0d37740a-3a4b-4b03-ac88-c0744cbad3c3","year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.653492Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:4393f1586a1acd3a1a1aca1dade6440a9f606d0b1844f4daef7c2909f604366e","observation_id":"0115e4cf-721c-4f46-9eb9-de17847d53eb","resolution":{"observed_at":"2026-08-10T22:18:03.381856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12792","last_updated":"2023-09-22T01:44:46Z","snapshot_observed_at":"2026-08-08T14:04:39.691656Z","submitted_at":"2023-08-24T13:47:16Z","title":"Sparks of Large Audio Models: A Survey and Outlook","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12792","snapshot_observed_at":"2026-08-10T22:18:01.658865Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.658865Z"},"links":{"cited_paper":"/paper/2308.12792","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:13abe2f1389a4b1d841795e74808d5171defbbb1ae81acd9b50a4b507e7a74f7","observation_id":"8799987d-4c64-45a9-be1c-410a45cd3d9c","resolution":{"observed_at":"2026-08-10T22:18:01.658865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03900","last_updated":"2024-08-07T16:55:28Z","snapshot_observed_at":"2026-07-31T02:18:44.196348Z","submitted_at":"2024-08-07T16:55:28Z","title":"Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03900","snapshot_observed_at":"2026-08-10T22:18:01.663850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.663850Z"},"links":{"cited_paper":"/paper/2408.03900","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:491ee3b50a06b80351eaea05731cefdc927358d16b3256bfbab4233587f5de30","observation_id":"256b2189-67b7-47ef-a118-8261b5c7fd61","resolution":{"observed_at":"2026-08-10T22:18:01.663850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.358287Z","title":null,"venue":null,"work_id":"666e9a03-3928-4d66-933c-7c93d8914598","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.669010Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:798bea833c28478d71cf991f7219715274dca66d66da77fa1aa90309decac21c","observation_id":"806e12d1-8eb8-47a9-aed8-cb59242914d9","resolution":{"observed_at":"2026-08-10T22:18:03.363918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14920","last_updated":"2020-10-28T12:33:04Z","snapshot_observed_at":"2026-08-08T08:50:11.726968Z","submitted_at":"2020-10-28T12:33:04Z","title":"Bridging the Modality Gap for Speech-to-Text Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14920","snapshot_observed_at":"2026-08-10T22:18:01.676462Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.676462Z"},"links":{"cited_paper":"/paper/2010.14920","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:65ce89c8ec75e7cf28d2d6806962d7332021ebf411258a1acb868d30d3473f41","observation_id":"e3cd9b70-8b15-47fd-b296-a2514ce960d1","resolution":{"observed_at":"2026-08-10T22:18:01.676462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8356.24688","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.815050Z","title":null,"venue":null,"work_id":"ab4d8dba-b30d-43b1-bcfb-c4682609c74f","year":2013},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.682072Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:01bd130a896cf76755d1622574c60570a3fa527efa694743c2f15a8010df20cb","observation_id":"cdb43061-e459-472f-b3f2-da6fab3196c9","resolution":{"observed_at":"2026-08-10T22:18:02.824558Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.687235Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.687235Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:25513a724e44b98354155cdecbff856937d2410d4a66ea625dc9796b3f66710b","observation_id":"466f143f-f364-478c-b65d-e4e593f55972","resolution":{"observed_at":"2026-08-10T22:18:01.687235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02248","last_updated":"2024-06-14T17:57:13Z","snapshot_observed_at":"2026-08-10T13:07:09.316381Z","submitted_at":"2023-11-03T21:47:03Z","title":"COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02248","snapshot_observed_at":"2026-08-10T22:18:01.693105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.693105Z"},"links":{"cited_paper":"/paper/2311.02248","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:b0a7fab119cf393a48eaa091e81231b0228842d0d47c9ef3f969ee29e2fb2cf0","observation_id":"36cd5e72-c0b7-4a5e-96fc-e1f6397f3ac3","resolution":{"observed_at":"2026-08-10T22:18:01.693105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.698618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.698618Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:085898ac24cb88aab27acb6940e5804681af3746043e0579ec5a7274d31e7eab","observation_id":"246de955-aec3-410f-a4e0-3c73c6c6d1a6","resolution":{"observed_at":"2026-08-10T22:18:01.698618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18495","last_updated":"2024-12-24T15:26:31Z","snapshot_observed_at":"2026-08-11T04:39:20.649486Z","submitted_at":"2024-12-24T15:26:31Z","title":"How \"Real\" is Your Real-Time Simultaneous Speech-to-Text Translation System?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18495","snapshot_observed_at":"2026-08-10T22:18:01.704779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.704779Z"},"links":{"cited_paper":"/paper/2412.18495","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:aac969fa9b4c76de46e158b67d9f089a0ace761816c49a6f0e44f7e24cb871d8","observation_id":"e4057a89-793b-438e-a24d-9f910f5a11fc","resolution":{"observed_at":"2026-08-10T22:18:01.704779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.710676Z","title":"Park, William Chan, Yu Zhang, Chung-Cheng Chiu, Barret Zoph, Ekin D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.710676Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:84b5ffedc8dbaf89bdec17eadaa551e00e992d6bd11f4f037b10d8d9f9c03e17","observation_id":"f719ed18-019d-4485-ba60-dfa1a8cbb67e","resolution":{"observed_at":"2026-08-10T22:18:01.710676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.718564Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.718564Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:c14ef5cb7aae088d621aed4d6155de27062b6fca277ffeebe8c6e0c300355bfa","observation_id":"3209d94a-e7e1-45ff-859a-b2e20fa5ceba","resolution":{"observed_at":"2026-08-10T22:18:01.718564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.724578Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.724578Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:3b38809e8287ebb8126811cf4342fd016340a049524aee147f2f65f3c0cb0b86","observation_id":"4d804dca-fb92-44b3-8cc1-071290405279","resolution":{"observed_at":"2026-08-10T22:18:01.724578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.730703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.730703Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:433a6781f3ef58d0472fad799772e61bae286ab461ca8cce26ad2d6d9d15a37e","observation_id":"69a02b05-5d6d-4b4e-b1ee-e0c005a3b919","resolution":{"observed_at":"2026-08-10T22:18:01.730703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.739051Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.739051Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:c761cc98ded65cbe7f562890460a3d7bc39afe98cc4d0deb39ac6188aaa64de9","observation_id":"edcbf2c9-c3c0-4f04-bd45-b7937242395b","resolution":{"observed_at":"2026-08-10T22:18:01.739051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.749335Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.749335Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:161f1dff5ce72bba678737199c6ebca9982d0d95260724fe2dc10835534c684a","observation_id":"4da58c74-06dc-4733-93b5-c4d7593c3af8","resolution":{"observed_at":"2026-08-10T22:18:01.749335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.759295Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.759295Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:b39b180640f672b883323ea32b6c1fed72214b8649ed223dd05590079e8e7876","observation_id":"1fba9d1e-d065-4ba1-949c-e8de8356654b","resolution":{"observed_at":"2026-08-10T22:18:01.759295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-10T22:18:01.765430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.765430Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:263de013c4caba96a72fc3c020de572ac2af8e19fdb3d37302a3a11a9756fb39","observation_id":"6a6f444c-2183-44cf-ab36-322bbcb87733","resolution":{"observed_at":"2026-08-10T22:18:01.765430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T22:18:01.773692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.773692Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:bc83cde4e184c7a8da32873e7b35649498226a324f87a26e341ca757e6845533","observation_id":"4ed36dde-8573-4f60-8e79-f392e325972d","resolution":{"observed_at":"2026-08-10T22:18:01.773692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:18:01.779841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.779841Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:66e89e40b529e937410a9507195bb56e3902c2834ec6049c50bd6ae4c357a960","observation_id":"46f9c9c7-73d9-47be-b23f-91df747c0546","resolution":{"observed_at":"2026-08-10T22:18:01.779841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.786265Z","title":"G \\'a llego, Jos \\'e A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.786265Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:209425990056b86ea329edc9c4c40ae4fac15b13f3ad296e8cd6b00924cfbb2b","observation_id":"203e68d0-e43c-453f-94bb-ab6fe7c00206","resolution":{"observed_at":"2026-08-10T22:18:01.786265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-59","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.965753Z","title":"Gállego, José A","venue":null,"work_id":"8218ea54-47ed-4de6-8bc6-145f29c9310c","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.791567Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:b8fdfa3ac9f8bc31db1bca9642a73944236b580fa1a7b4c3c0199da99766d795","observation_id":"7a2a09cc-e600-4eb8-af59-8b27d1c38858","resolution":{"observed_at":"2026-08-10T22:18:01.970986Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08876","last_updated":"2024-01-09T09:02:23Z","snapshot_observed_at":"2026-08-11T01:54:02.175256Z","submitted_at":"2023-09-16T04:57:37Z","title":"Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08876","snapshot_observed_at":"2026-08-10T22:18:01.797969Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.797969Z"},"links":{"cited_paper":"/paper/2309.08876","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:3c02ef940461998518301c3ac97d5e29dd12c07e828ab3695b24d4a199d30f81","observation_id":"e53bfefd-adc3-4cb6-9abb-cdd0ff7e0f80","resolution":{"observed_at":"2026-08-10T22:18:01.797969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16107","last_updated":"2024-08-01T13:55:54Z","snapshot_observed_at":"2026-08-11T13:35:52.201661Z","submitted_at":"2024-06-23T13:50:08Z","title":"Decoder-only Architecture for Streaming End-to-end Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16107","snapshot_observed_at":"2026-08-10T22:18:01.804040Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.804040Z"},"links":{"cited_paper":"/paper/2406.16107","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:d0b177be3bafee46cb06980841311d20909714508e6b1f5cb2cf4140b990dd4b","observation_id":"968d45f1-92ec-4447-9021-36170cbc3b77","resolution":{"observed_at":"2026-08-10T22:18:01.804040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.811218Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.811218Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:febd35d74895ad25f41af1f5bc41d9800d0162b56fede04688b252b1613cc589","observation_id":"c7c732f0-f88c-4ff2-8108-13a27d9f7fbe","resolution":{"observed_at":"2026-08-10T22:18:01.811218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17044","last_updated":"2025-06-03T10:28:07Z","snapshot_observed_at":"2026-08-06T05:03:26.091857Z","submitted_at":"2024-09-25T15:54:29Z","title":"How to Connect Speech Foundation Models and Large Language Models? What Matters and What Does Not","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17044","snapshot_observed_at":"2026-08-10T22:18:01.816674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.816674Z"},"links":{"cited_paper":"/paper/2409.17044","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:a62c1dedb67af290cb8df14c304925d43ec781eef15e67672103e2fc42080e5c","observation_id":"0b180781-470c-4722-afd9-cc36cdc536ee","resolution":{"observed_at":"2026-08-10T22:18:01.816674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.824647Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.824647Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:357707f69046eb529a6f60ec4989dbcc6238efbaf7e04f4cb44d15e21e4bbc40","observation_id":"644d796c-cb4b-48ad-a834-32c75b6bac46","resolution":{"observed_at":"2026-08-10T22:18:01.824647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.255707Z","title":null,"venue":null,"work_id":"3045f7da-6258-468c-9d29-6a66ea78ccd3","year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.831175Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:f243e947a1bf759b56dad552bbe1748889ddaa2d3b3f5470fe81b4a6e8d5c322","observation_id":"50f35035-05eb-4bf6-8366-b0ebf5ae317a","resolution":{"observed_at":"2026-08-10T22:18:03.265035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00230","last_updated":"2023-09-30T02:27:45Z","snapshot_observed_at":"2026-08-11T11:10:10.107804Z","submitted_at":"2023-09-30T02:27:45Z","title":"SLM: Bridge the thin gap between speech and text foundation models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00230","snapshot_observed_at":"2026-08-10T22:18:01.839297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.839297Z"},"links":{"cited_paper":"/paper/2310.00230","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:0f8b8d5553b893cd8e04d54ecb817b4535c5443fdb4a5cc253e1e10ceb79b3fc","observation_id":"750102ff-069e-4043-b423-4e8dbce94f38","resolution":{"observed_at":"2026-08-10T22:18:01.839297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.08581","last_updated":"2017-06-12T13:54:12Z","snapshot_observed_at":"2026-07-06T05:35:07.974673Z","submitted_at":"2017-03-24T19:45:24Z","title":"Sequence-to-Sequence Models Can Directly Translate Foreign Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.08581","snapshot_observed_at":"2026-08-10T22:18:01.845871Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.845871Z"},"links":{"cited_paper":"/paper/1703.08581","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:cf21e2838cd20b72e28ae9b83f2f0326e1256beda1808f029b4f16f38758d20e","observation_id":"0fccce70-8841-4921-8626-f3f84e2f7aa7","resolution":{"observed_at":"2026-08-10T22:18:01.845871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.851106Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.851106Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:b499ffdf6b189319eedd28af627d980f167b586a3e2790ceea44c901624f6ad3","observation_id":"393cfcda-844f-4c8b-8c67-a64940f5100e","resolution":{"observed_at":"2026-08-10T22:18:01.851106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-naacl.91","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.929934Z","title":null,"venue":null,"work_id":"25c4b20e-936d-4710-8aee-8e3798fafdbb","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.857584Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:9029cad6b95a896c654ae97b001bc48d10353e61ae1352afcc35c48402c2482b","observation_id":"b3d35543-044d-4a02-98fb-3b5d6cea7074","resolution":{"observed_at":"2026-08-10T22:18:01.937062Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13523","last_updated":"2024-09-20T14:03:23Z","snapshot_observed_at":"2026-07-06T19:18:45.024436Z","submitted_at":"2024-09-20T14:03:23Z","title":"EMMeTT: Efficient Multimodal Machine Translation Training","version":1},"cited_work":{"arxiv_id":"2409.13523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13523","snapshot_observed_at":"2026-08-10T22:18:02.388573Z","title":"EMMeTT: Efficient Multimodal Machine Translation Training","venue":"cs.CL","work_id":"b2fb8744-6a1a-4d1f-9afe-cf659144b907","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.863187Z"},"links":{"cited_paper":"/paper/2409.13523","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:aa0d058a31055940057e7299145c0037c90c535e32d0cdd70e13d4f8440fa132","observation_id":"facb8f58-7fed-4995-8aa3-8c9320ef2013","resolution":{"observed_at":"2026-08-10T22:18:02.395738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02727","last_updated":"2021-02-22T20:17:07Z","snapshot_observed_at":"2026-08-10T07:31:28.464153Z","submitted_at":"2019-11-07T02:47:26Z","title":"Understanding Knowledge Distillation in Non-autoregressive Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02727","snapshot_observed_at":"2026-08-10T22:18:01.868319Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.868319Z"},"links":{"cited_paper":"/paper/1911.02727","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:233a655babd7a43abbd733c0eab35bc597afa4f0a1c74cc6ab9f1815266ed800","observation_id":"88b24748-0963-43be-b838-277307e7072f","resolution":{"observed_at":"2026-08-10T22:18:01.868319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15712","last_updated":"2025-05-30T16:35:44Z","snapshot_observed_at":"2026-08-11T18:24:52.709864Z","submitted_at":"2024-12-20T09:33:31Z","title":"Contrastive Learning for Task-Independent SpeechLLM-Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15712","snapshot_observed_at":"2026-08-10T22:18:01.876712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.876712Z"},"links":{"cited_paper":"/paper/2412.15712","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:99100dab67345d7fae33b596a7adc5ea0315f114296bb131c7ef36fe162f3eeb","observation_id":"90e60d0c-b511-4a28-bb23-4298f8d61ce6","resolution":{"observed_at":"2026-08-10T22:18:01.876712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T22:11:41.494483Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":63,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2501.02370."}