{"as_of":"2026-08-19T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a47001f3b5beb40ec0b6b933630e3eee63186d73262b13064985a1369e505d51","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:30:54.980427Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.15415/citation-record","integrity":"/paper/2412.15415/integrity","json":"/paper/2412.15415/citation-record.json","paper":"/paper/2412.15415"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-17T17:18:07.224353Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-11T11:30:54.873361Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.873361Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:dc34ec5ed0095d155eeeacb4b1a0aa8cc0de38964d21887a045eb0dc8e0baddf","observation_id":"86e5cc7c-7bd3-496a-9681-17db7bf020ab","resolution":{"observed_at":"2026-08-11T11:30:54.873361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.338026Z","title":"Strea- mAtt: Direct streaming speech-to-text translation with attention-based audio history selection,","venue":null,"work_id":"08aed5a6-eac4-4f2b-87ec-a0ffb83188d5","year":2024},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.878094Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:d47a7f169bf4c124ca8b992ff4ae68f388eefb9ae7405a22b6244ebf9efd21ba","observation_id":"cc5cbc68-ec10-4db1-872f-5d5f83056e33","resolution":{"observed_at":"2026-08-11T11:30:55.342257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03049","last_updated":"2024-06-05T08:24:22Z","snapshot_observed_at":"2026-08-16T13:45:59.479279Z","submitted_at":"2024-06-05T08:24:22Z","title":"StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03049","snapshot_observed_at":"2026-08-11T11:30:54.882243Z","title":"Streamspeech: Simultaneous speech-to-speech transla- tion with multi-task learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.882243Z"},"links":{"cited_paper":"/paper/2406.03049","citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:a68ae07792bddcada2752b20626756a07b214bbd1f3268fb1ee9a1fe36aa8032","observation_id":"14728ac5-8083-417b-826f-e79a91f97b8a","resolution":{"observed_at":"2026-08-11T11:30:54.882243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.327071Z","title":"A comparative study on end-to-end speech to text translation,","venue":null,"work_id":"04324546-8826-46ab-8eb1-db07a78bbd1a","year":2019},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.886399Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:d16c18a29eabe338882dd079f3023c1dea7f5c32a6bcf3a1938a1d2ed704dce0","observation_id":"7fea460e-6a89-4646-8529-81cf2d14f195","resolution":{"observed_at":"2026-08-11T11:30:55.330533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11010","last_updated":"2024-06-26T07:34:53Z","snapshot_observed_at":"2026-08-16T13:39:31.951914Z","submitted_at":"2024-06-26T07:34:53Z","title":"Navigating the Minefield of MT Beam Search in Cascaded Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11010","snapshot_observed_at":"2026-08-11T11:30:54.891114Z","title":"Navigating the minefield of mt beam search in cascaded streaming speech translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.891114Z"},"links":{"cited_paper":"/paper/2407.11010","citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:a80375ceb49b24fee079c217f8a42c52dd7187e6422c09846a0d87f38f63cbd1","observation_id":"35307ee9-8d49-4272-b0ac-81e13a8fd4a9","resolution":{"observed_at":"2026-08-11T11:30:54.891114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.315999Z","title":"End-to-end speech translation with knowledge distillation,","venue":null,"work_id":"4dfa69f4-4b0f-4888-bc76-06639c7f1941","year":2019},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.895771Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:a11f23a59e0e58d36fad8becbc30fd20d75974094a5821842934eb793a02edde","observation_id":"ebead768-663a-4dac-8207-ba460127a9bb","resolution":{"observed_at":"2026-08-11T11:30:55.320074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.305337Z","title":"Multilingual speech translation from efficient finetuning of pretrained models,","venue":null,"work_id":"84916921-6735-463d-96a7-160c7478fd9f","year":2021},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.899883Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:7459305156d6482299566991124ff0abb723409fede0da5226bb8a49da28677e","observation_id":"6f2d8820-edab-458e-b88c-1ca44e040fad","resolution":{"observed_at":"2026-08-11T11:30:55.309002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.293494Z","title":"ComSl: A composite speech-language model for end-to-end speech-to-text translation,","venue":null,"work_id":"1a44d6bc-04db-4a26-9de2-b6be24446179","year":2023},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.903817Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:969ff11e11a68e2797cee4ffa491ecfbd80308e551fdb7737cfc2d695078aa8a","observation_id":"8d1beb8e-1fc8-40e6-926b-4f9c09278418","resolution":{"observed_at":"2026-08-11T11:30:55.297698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-11T11:30:54.907705Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.907705Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:1e419c102ec46ef88e317937079ee77cb8b674d5dc6fd9027c127439eeb211b8","observation_id":"512bad9d-3990-4e07-b1fb-2fb75932973d","resolution":{"observed_at":"2026-08-11T11:30:54.907705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.280412Z","title":"Streaming end-to-end speech recognition for mobile devices,","venue":null,"work_id":"daa14ec5-93b1-4d0f-ae44-c114fe4f73d0","year":2019},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.911672Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:df88456245b8c198eedc9ff07218fbdbcd8eff422c1fbcba32848a4e16e409e1","observation_id":"0bd826f4-a64a-492e-96bd-c3ac2130af05","resolution":{"observed_at":"2026-08-11T11:30:55.284377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.269623Z","title":"Dual causal/non- causal self-attention for streaming end-to-end speech recognition,","venue":null,"work_id":"96e80e57-4da8-4908-ac96-bd73ea38c4cb","year":2021},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.915476Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:d42fe46cc9f22c975e87dd48e982270870696976538287980b09bfc5efc2c6cf","observation_id":"5cbcbe64-14b7-4719-b0cc-cd36732ae98c","resolution":{"observed_at":"2026-08-11T11:30:55.273040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.257958Z","title":"Token-level serialized output training for joint streaming asr and st leveraging textual alignments,","venue":null,"work_id":"ed3de6c0-6c93-4316-945b-ba1dbcbe5424","year":2023},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.919238Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:a67ca26ae3d771b5986d26fd3f25675b71bbe6a5495ea0c298d73b414cf6811b","observation_id":"424d7360-f75c-4898-876a-426b3685ce42","resolution":{"observed_at":"2026-08-11T11:30:55.261972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.245453Z","title":"Extended graph temporal classification for multi- speaker end-to-end ASR,","venue":null,"work_id":"e644b441-083e-41f7-b12f-c12f3ddb1a3a","year":2022},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.922840Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:33ca25319f02b503c087794286415d446dcfddfd0ac4055603baf606a60e2e3c","observation_id":"6f2c32db-c960-4501-a99d-2e92998482be","resolution":{"observed_at":"2026-08-11T11:30:55.249537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00842","last_updated":"2022-07-14T20:40:04Z","snapshot_observed_at":"2026-08-16T17:24:13.596989Z","submitted_at":"2022-02-02T01:27:21Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00842","snapshot_observed_at":"2026-08-11T11:30:54.925968Z","title":"Streaming multi-talker ASR with token-level serialized output training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.925968Z"},"links":{"cited_paper":"/paper/2202.00842","citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:02282d9706b4da5d76e59c2c0dcb1f8dfc5cac174709486f3a6174cb7501d3d9","observation_id":"ad8dca00-33b7-4fc8-8e42-b17d811a1ef8","resolution":{"observed_at":"2026-08-11T11:30:54.925968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.235181Z","title":"Cross attention augmented transducer networks for simultaneous translation,","venue":null,"work_id":"322d438b-edf5-46d6-94d7-57184088ce19","year":2021},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.929095Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:542e6b95d9150e20e1ff2b8462f8a126b7f9417effbad13ee173af3bee246797","observation_id":"93d656f7-3c2a-4d4d-8737-a6dd803d6adc","resolution":{"observed_at":"2026-08-11T11:30:55.238838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.224800Z","title":"Large- scale streaming end-to-end speech translation with neural transducers,","venue":null,"work_id":"8d05aefa-7f6c-42c7-af90-18f0c5232867","year":2022},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.931776Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:3f8e67f1e76f766b68d84eef2659f0f6e000c65fb903c3d18a1177418895e5f9","observation_id":"106e0c4a-3475-47ec-b7f3-da04155d88ff","resolution":{"observed_at":"2026-08-11T11:30:55.228418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.213321Z","title":"Lamassu: Streaming language-agnostic mul- tilingual speech recognition and translation using neural transducers,","venue":null,"work_id":"8a142925-0536-42a1-8f7c-c99d12dfb359","year":2023},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.934652Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:73185601fb65a36dbea9b7c81e08d6a3332d080a2ba520264632ed6e20084eff","observation_id":"696c84c9-ea74-48a6-b27b-cd479236b3bc","resolution":{"observed_at":"2026-08-11T11:30:55.217231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.202332Z","title":"Streaming parallel transducer beam search with fast-slow cascaded encoders,","venue":null,"work_id":"6371776e-94b2-4e20-adc1-ca9096d58891","year":2022},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.937728Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:d3d97addda099169888ff987bcd845c8696dc1fd04d6936a34796293081d5541","observation_id":"ad90d283-29ac-45ee-a699-17b2ce6f1e76","resolution":{"observed_at":"2026-08-11T11:30:55.206064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.191838Z","title":"Streaming transformer transducer based speech recognition using non-causal convolution,","venue":null,"work_id":"9175adef-2453-458b-a809-bb3cf931f723","year":2022},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.940878Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:c42c2c36b402bf005166f948659a1136f13f044f4165dfd98ffd8ebe194020a8","observation_id":"f35e9cf1-7b9f-44d1-99ba-849f091e97d3","resolution":{"observed_at":"2026-08-11T11:30:55.195364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.180248Z","title":"AGADIR: Towards array-geometry agnostic directional speech recognition,","venue":null,"work_id":"0899ba56-8fda-4cbc-97c0-b9404347ef3b","year":2024},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.943885Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:7171d65a457549e53c24396fc0318457df3c2c823b90e5c6299477ecdb950f8e","observation_id":"f8e47b8b-a212-4cbe-80f7-b8ce029c421f","resolution":{"observed_at":"2026-08-11T11:30:55.184371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.166858Z","title":"Directional speech recognition for speaker disambiguation and cross-talk suppression,","venue":null,"work_id":"5f7cd9f6-be65-4e06-94fa-f0283d77954c","year":2023},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.946785Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:3e754666720dd767fa1d141bb643e50a83110ac0fde738fb9be4c24238d69b64","observation_id":"8e53f27c-3b32-4ae0-8f62-6da2071d6fff","resolution":{"observed_at":"2026-08-11T11:30:55.171162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.153673Z","title":"FLEURS: Few-shot learning evaluation of universal representations of speech,","venue":null,"work_id":"58bc72be-8677-47ba-961b-13d319e0b882","year":2023},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.949920Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:4d83d456786881ea32dba4b47aa09afbccac26dfda0b46a471c8c7b93cb8d175","observation_id":"92d476c5-10ee-462a-9040-1b29b027c162","resolution":{"observed_at":"2026-08-11T11:30:55.158349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.141612Z","title":"Word alignment by fine-tuning embeddings on parallel corpora,","venue":null,"work_id":"c949a299-fa7d-449f-948e-522a20315e3b","year":2021},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.954909Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:7c4e4fb251f2ba26780b430c815f01b280feb161765734ddf9f0aa620be58711","observation_id":"49363cbe-58e8-4361-ba8a-d2d6b124f612","resolution":{"observed_at":"2026-08-11T11:30:55.145667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.129365Z","title":"The CHiME- 8 MMCSG Challenge: Multi-modal conversations in smart glasses,","venue":null,"work_id":"2545ae6d-a42d-4d62-9178-6e9ad84543a9","year":2024},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.958868Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:19abd174650262a9d8f2a56cad88a7c9a3ce165d5756575c77df8564e10bd27d","observation_id":"7de69e08-4efd-427d-a9c5-8c5d58ce77ba","resolution":{"observed_at":"2026-08-11T11:30:55.133245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.04944","last_updated":"2020-05-01T10:49:00Z","snapshot_observed_at":"2026-08-18T11:39:46.005623Z","submitted_at":"2019-11-10T12:09:46Z","title":"CCMatrix: Mining Billions of High-Quality Parallel Sentences on the WEB","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.04944","snapshot_observed_at":"2026-08-11T11:30:54.962759Z","title":"CCMatrix: Mining billions of high-quality parallel sentences on the web,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.962759Z"},"links":{"cited_paper":"/paper/1911.04944","citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:a450f134475c191eb1b55a5536550c3388d5b4c4eed218ad09a6a1c763094477","observation_id":"4fd6157e-9f6e-46e5-9444-1df7ab2e4a8b","resolution":{"observed_at":"2026-08-11T11:30:54.962759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.117769Z","title":"Beyond english-centric multilingual machine translation,","venue":null,"work_id":"f153182f-200d-4323-aa44-d921de6df27e","year":2021},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.967336Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:12d43dc17d68f5ec71e3046424f62c8734cb9e2e43c2321bd81e338153814bac","observation_id":"ec52ab41-d255-4ceb-ba7b-808fd5c9990c","resolution":{"observed_at":"2026-08-11T11:30:55.121279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.106479Z","title":"Opensubtitles2016: Extracting large parallel corpora from movie and tv subtitles,","venue":null,"work_id":"45a1eff3-c703-4dcd-a3a6-ea480935fc67","year":2016},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.971009Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:0924be342d72f799cf94b826fb55aafda5c24ef60802828cfe3c079ea438e041","observation_id":"3066038c-9a27-45aa-ac6d-121b9fd789fd","resolution":{"observed_at":"2026-08-11T11:30:55.110074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.093713Z","title":"Building subject-aligned comparable corpora and mining it for truly parallel sentence pairs,","venue":null,"work_id":"996bc219-9f5a-4b99-880d-a953d56cea20","year":2014},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.974901Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:5c79690ad5d46351f7f1f595636cbcae63c5b679700b2164b126e6e9d5ceead5","observation_id":"63b8f64c-4a4e-4437-969e-8ed9e568dda3","resolution":{"observed_at":"2026-08-11T11:30:55.098512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:55.080018Z","title":"Chime 8 task 3: Multi-talker word error rate,","venue":null,"work_id":"836cc264-d175-4fb0-abfa-15dcc5bbe578","year":null},"citing_paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:54.980427Z"},"links":{"citing_paper":"/paper/2412.15415"},"observation_digest":"sha256:5aee05170d049514a22471bc877c75813d16d21750f860492d19256fa35743b4","observation_id":"f4bccd77-b549-4c97-a813-75e3c1c64b25","resolution":{"observed_at":"2026-08-11T11:30:55.085628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.15415","last_updated":"2024-12-19T21:57:01Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T13:58:47.611669Z","submitted_at":"2024-12-19T21:57:01Z","title":"Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2412.15415."}