{"as_of":"2026-08-07T16:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73a3f5e0fef8a8f98a47b2092ed6eae5df008fa11af2abc862c268c5187d2338","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:34:09.446488Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.17019/citation-record","integrity":"/paper/2506.17019/integrity","json":"/paper/2506.17019/citation-record.json","paper":"/paper/2506.17019"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T23:34:06.447360Z","title":"arXiv preprint arXiv:2503.01743","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.447360Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:8c0e0a484b7eacbadb8a242de2aa0fc12035247e7bd1e956ff459004c25316cc","observation_id":"f723c553-dd42-4d7d-b2bf-1f1b8bea7139","resolution":{"observed_at":"2026-08-06T23:34:06.447360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:06.624600Z","title":"arXiv preprint arXiv:2503.10620","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.624600Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:1d01e64da37a8deb0408337627b513a7b624c227851192d995d25c03a102119b","observation_id":"88e5864e-a2e5-4be5-a0b6-af6a54601ce3","resolution":{"observed_at":"2026-08-06T23:34:06.624600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T23:34:06.960891Z","title":"arXiv preprint arXiv:2407.10759","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.960891Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:0195b9bf97d7711fb5d25315a25fec03431c65acbd08f1db36dbc272c4715075","observation_id":"7e6a1902-06e1-4559-98fb-e208df2133fc","resolution":{"observed_at":"2026-08-06T23:34:06.960891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T23:34:07.072917Z","title":"arXiv preprint arXiv:2311.07919","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.072917Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:fb11fd88373903e5b69ea9b23fff6297a4439e11107718bdcc2538c5a77b87b1","observation_id":"483e7c21-5dfc-4b52-bfac-70f87284c879","resolution":{"observed_at":"2026-08-06T23:34:07.072917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:11.117562Z","title":"In 2022 IEEE Spoken Language Technology Workshop (SLT), pages 798–805","venue":null,"work_id":"0e02cdc9-7a74-4e5f-86aa-7c5fac0f10ad","year":2022},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.129512Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:2190da43ea9de799efe075512e737cb8d4a269fac20063f2930557cc73e9c7b0","observation_id":"a3ff050c-a152-471c-940b-a48d59925cba","resolution":{"observed_at":"2026-08-06T23:34:11.169768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T23:34:07.278388Z","title":"arXiv preprint arXiv:2409.17146","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.278388Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:17bb9f5159bb064b2cc48d48441907a8a1f48ab5c316822c829e33501f6f3bee","observation_id":"3e69669d-9fc9-4cac-bb93-3d48cdd6be69","resolution":{"observed_at":"2026-08-06T23:34:07.278388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T23:34:07.562021Z","title":"arXiv preprint arXiv:2408.00118","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.562021Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:e44cecf2955b80293bcca1f5e6c23fc212c57a4fb11de5cb51affe445e0b375b","observation_id":"6dcc4476-94e2-48e5-b951-dbf7ab1d4ac7","resolution":{"observed_at":"2026-08-06T23:34:07.562021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:34:07.676909Z","title":"arXiv preprint arXiv:2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.676909Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:016270129563780dae1872806812e40dd3f886c741a14e83c99ce03df157762a","observation_id":"36ee1ed8-a703-4db4-8cbf-4966191d8a52","resolution":{"observed_at":"2026-08-06T23:34:07.676909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.978126Z","title":"In Findings of the Asso- ciation for Computational Linguistics: EMNLP 2024, pages 4552–4572, Miami, Florida, USA","venue":null,"work_id":"e267a3d0-e41a-4d0a-a80e-9f5e01600797","year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.937565Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:9b24a622231d208a70315b6c0d278e87d7a764b0b21a8908d91d2b69f393bfe7","observation_id":"c7cc3634-92b5-4eea-86da-8264703a0e80","resolution":{"observed_at":"2026-08-06T23:34:11.046606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13585","last_updated":"2023-12-21T05:32:49Z","snapshot_observed_at":"2026-07-06T17:06:21.022948Z","submitted_at":"2023-12-21T05:32:49Z","title":"Speech Translation with Large Language Models: An Industrial Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13585","snapshot_observed_at":"2026-08-06T23:34:08.081674Z","title":"arXiv preprint arXiv:2312.13585","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.081674Z"},"links":{"cited_paper":"/paper/2312.13585","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:c4d018baa08669df13d3bf70d90b58cbc50b984f4873e154dc1cdc3f1bdf51dc","observation_id":"d1bc3b29-c5cb-4d4e-9183-02054e959fba","resolution":{"observed_at":"2026-08-06T23:34:08.081674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.635026Z","title":"In ICASSP 2024-2024 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 13326–13330","venue":null,"work_id":"8d07482a-406c-4ebb-8f83-dda9e0d80a2d","year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.247414Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:2baf5f1b3c578e49d9e3b77900c9bdcb53e81cd7a985fa9f88a149d74b7154d7","observation_id":"c2cc3502-ee96-4697-b803-f288712f68e8","resolution":{"observed_at":"2026-08-06T23:34:10.732535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-06T23:34:08.333794Z","title":"Preprint, arXiv:2409.16235","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.333794Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:02e38847a7e9d4daf45c08ef460e95c0fd57c3466f0526f06f8998e4c899aa70","observation_id":"912abaa8-18dd-420b-b3a2-6c4210d234ec","resolution":{"observed_at":"2026-08-06T23:34:08.333794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.209260Z","title":null,"venue":null,"work_id":"bdca4107-5de1-4777-bc16-ee0446a51d22","year":2020},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.694602Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:8111015be94914d5aaa597b8487d74a0a366af8de5844ae1f6f1a3ea18f6e4db","observation_id":"52b9ffae-d251-4592-8138-9f2843071aff","resolution":{"observed_at":"2026-08-06T23:34:10.304258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:09.994463Z","title":"In Proceedings of the Seventh Conference on Machine Translation (WMT) , pages 634–645, Abu Dhabi, United Arab Emirates (Hybrid)","venue":null,"work_id":"ce19ba77-ef8e-463a-9758-d5abf7c0bdd3","year":2022},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.823192Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:2fb4af7b1f6397e4d12fa2e90986b0be8edf450422fa245458361ac7cf97f39b","observation_id":"8be90602-4665-47d1-9e30-66dedbaac60b","resolution":{"observed_at":"2026-08-06T23:34:10.105964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-06T23:34:08.892983Z","title":"arXiv preprint arXiv:2306.12925","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.892983Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:0bca7ae1294d9003275bbcecd95d3db2ecef537ea96e141d3e831feaa92ebc03","observation_id":"3769e255-2bcd-4641-a8d3-7107add7efd4","resolution":{"observed_at":"2026-08-06T23:34:08.892983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-06T23:34:08.989599Z","title":"arXiv preprint arXiv:2310.13289","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.989599Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:3b7e8355029a84b001e9df847792cef598083d479a907528efc759b4fef09835","observation_id":"ee251e65-6943-49ba-b351-b7e7d8353639","resolution":{"observed_at":"2026-08-06T23:34:08.989599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-06T23:34:09.173525Z","title":"Preprint, arXiv:2101.00390","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:09.173525Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:8fc5b018940d7a8815831b8a164b2e2923254c0fef272727802dd81796c798d5","observation_id":"9d90560f-7ae2-47ac-a5cf-b99fa37eaee7","resolution":{"observed_at":"2026-08-06T23:34:09.173525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-01T17:44:35.425095Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-08-06T23:34:09.324302Z","title":"arXiv preprint arXiv:2007.10310","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:09.324302Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:63f0b0b55dce7277ce9f4d782ac47fb99f286bfe6919f8a44d5deb6e1b02f3be","observation_id":"2cd2468b-8d69-4899-8a8f-edfd7ca0502b","resolution":{"observed_at":"2026-08-06T23:34:09.324302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T23:34:09.446488Z","title":"arXiv e-prints, pages arXiv–2305","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:09.446488Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:413a8a345efca5c23790e7c10ca2a30fa01680a2bef445a0684a49cfedf59651","observation_id":"cc82fe11-6225-4091-9bae-df733af749d4","resolution":{"observed_at":"2026-08-06T23:34:09.446488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.389665Z","title":"In 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP), pages 5206–5210","venue":null,"work_id":"1bcdca26-f704-46fc-bc04-d4085f6dd8e5","year":2015},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.567919Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:b2a623ccf373a78c224a434539f5da650617157ad113af4ab1e87c605502882b","observation_id":"75a282bb-6d7c-4218-9015-e2b28c55ef58","resolution":{"observed_at":"2026-08-06T23:34:10.497929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.831793Z","title":null,"venue":null,"work_id":"974b48c8-f96d-4d0b-846a-4904ea3c2fe2","year":2018},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.177645Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:47a0a76ff5953694d9ef6e9df94454e9750bffa39834ee84cd6e91f73943a0fd","observation_id":"3cbfb931-1243-401a-9c4d-1451cfd44ed1","resolution":{"observed_at":"2026-08-06T23:34:10.891849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T23:34:07.813102Z","title":"Preprint, arXiv:2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.813102Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:66765b11b045b9cb38b1f278d565734b771742cb3a95d6d6595bd48d1f18656a","observation_id":"da49e256-227c-4898-9ed6-4c9792f3051c","resolution":{"observed_at":"2026-08-06T23:34:07.813102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-06T23:34:07.432916Z","title":"Preprint, arXiv:2111.09344","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.432916Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:f0cf174363f61a13a5da9baca5dbe294a0367fabbc29df3b408c097996443bef","observation_id":"82dc9500-d820-4672-8a3b-a1b4f3ff12c7","resolution":{"observed_at":"2026-08-06T23:34:07.432916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-06T23:34:08.449809Z","title":"arXiv preprint arXiv:2207.04672","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.449809Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:f012f66d3cbc503ba2944a85f84acede1c89bc644d1f1f64a894b629d131b778","observation_id":"97ce2ada-7205-422f-9073-2058f440d569","resolution":{"observed_at":"2026-08-06T23:34:08.449809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T23:34:06.852611Z","title":"arXiv preprint arXiv:2312.05187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.852611Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:600a53350e660b5d0b1f6cf9d3fee4d1e357056ac9b577c239e2c14c4357e8ab","observation_id":"8117339d-05be-41c1-85d4-dc3e9f67baea","resolution":{"observed_at":"2026-08-06T23:34:06.852611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:11.240322Z","title":"In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pages 21318–21340, Miami, Florida, USA","venue":null,"work_id":"71994d53-35e6-4cf5-af04-ae145cab730e","year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.715685Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:69aa8c2afefff1c41b38e90f5d04ebd31fe21daacdd1f04a918ec8268ff06ff9","observation_id":"cf7879b9-d990-47df-88d3-753e3a0f641b","resolution":{"observed_at":"2026-08-06T23:34:11.300091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:11.367963Z","title":"In Proceedings of the 22nd Interna- tional Conference on Spoken Language Translation (IWSLT 2025), Vienna, Austria (in-person and on- line)","venue":null,"work_id":"661e9fbf-6945-4737-9d3f-08a99705efc7","year":2025},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.365008Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:7f68cd91f616bb685114d60e6d3c0e6bf8136022c611339aeb81c7b54ac43357","observation_id":"d21fd134-09ea-408a-994e-1be5c6334827","resolution":{"observed_at":"2026-08-06T23:34:11.419483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.17019."}