{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2de80543bf9218da70f44ea9b6c22c0e2c52a7d803fa5ca8c1d7a7c42da259e6","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T16:30:39.575148Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.15692/citation-record","integrity":"/paper/2509.15692/integrity","json":"/paper/2509.15692/citation-record.json","paper":"/paper/2509.15692"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.02012","last_updated":"2016-06-07T03:38:46Z","snapshot_observed_at":"2026-07-06T04:59:01.701765Z","submitted_at":"2016-06-07T03:38:46Z","title":"Can neural machine translation do simultaneous translation?","version":1},"cited_work":{"arxiv_id":"1606.02012","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.02012","snapshot_observed_at":"2026-07-02T22:47:25.691310Z","title":"Can neural machine translation do simultaneous translation?","venue":"cs.CL","work_id":"256c6622-cf7a-4f3c-b532-a512f4c14c81","year":2016},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/1606.02012","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:1fed3b4b363befece56543761fbd7c0a611207f8e3c098a0502e761e895e5be4","observation_id":"c843852a-3bee-44dc-b5b5-17405dfc9ab4","resolution":{"observed_at":"2026-05-18T16:31:36.823363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online and linear-time attention by enforc- ing monotonic alignments","venue":null,"work_id":"3867805b-85c1-41f6-98d2-86dccb99a7a3","year":2017},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:26f6c80d827c1979caae9fecd08d4b2b43547eee3d644a3b3593ce4e8344f807","observation_id":"5b36bc1d-782a-4d35-91ee-7fa9a60cb686","resolution":{"observed_at":"2026-05-18T16:31:37.926646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monotonic infinite lookback attention for simul- taneous machine translation","venue":null,"work_id":"5f33aa0d-0d4c-45db-9d61-9ee8e6f2daa5","year":2019},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:780205ecde55663ca5dadcd9b6404294708d76508d4f51467a755ee35c7e3d6d","observation_id":"6ab5d3ee-e123-45b8-ab31-960f6d728406","resolution":{"observed_at":"2026-05-18T16:31:37.920539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13036","last_updated":"2024-02-20T14:23:34Z","snapshot_observed_at":"2026-07-06T17:32:52.500465Z","submitted_at":"2024-02-20T14:23:34Z","title":"SiLLM: Large Language Models for Simultaneous Machine Translation","version":1},"cited_work":{"arxiv_id":"2402.13036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13036","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sillm: Large language models for simultaneous machine translation","venue":null,"work_id":"742c0f9c-317f-47fe-a689-5bac6344765a","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2402.13036","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:751d13bd677911b8a6765bca6f046a96ff70c2178bed42067c13ad2c31507bb9","observation_id":"37548497-bc25-48ac-a701-967a05de8dd2","resolution":{"observed_at":"2026-05-18T16:31:36.842019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct segmentation models for streaming speech translation","venue":null,"work_id":"ea5371d2-c8d3-42d8-b4cb-695e1414bb30","year":2020},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:0676b0fe2df02076bb2b276cfecb33fca4dbc052bfd99efd88a6058d4d40dfff","observation_id":"1dbb89a1-2a4d-4731-8360-684a038f5dd3","resolution":{"observed_at":"2026-05-18T16:31:37.923442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct simultaneous speech-to-text translation assisted by syn- chronized streaming asr","venue":null,"work_id":"94e4fd93-14c4-4240-8b19-c70eb41ecbb3","year":2021},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:bc8641c56ef454e0ed900f49ae197a13c864f67b24bc6824c5521ddb2a3b40c1","observation_id":"90cdea54-c8d8-4ce0-8125-0d063c756d4a","resolution":{"observed_at":"2026-05-18T16:31:37.930069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- cent advances in end-to-end simultaneous speech translation","venue":null,"work_id":"a847ea96-296f-4325-8619-43ea7c356387","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:300e997c80ff51beacd8508b793eaebc42fa6f2fe05db6386f1e59e71bb9253a","observation_id":"0d6042c5-28dd-4faa-9b2b-27721b76bb52","resolution":{"observed_at":"2026-05-18T16:31:37.963171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing when to translate for streaming speech","venue":null,"work_id":"c7b84849-b96d-4ee0-9824-a95ba71b168e","year":2022},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:441d0219afb21c4d3eeb6b05ca7f6f04001b533369e0234e93660587536138ab","observation_id":"bb553127-5668-449d-a4fc-53389ee7699f","resolution":{"observed_at":"2026-05-18T16:31:37.948997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end simultaneous speech translation with differentiable segmentation","venue":null,"work_id":"ef231fc5-a4f1-4c09-98d8-cfee880c35a0","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:4c94c92f29bc769033cbd208418dcb86b6d9c4e26c007fe18298a560c44944d3","observation_id":"52efd8da-7533-4a91-80de-676e371f1620","resolution":{"observed_at":"2026-05-18T16:31:37.933369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15729","last_updated":"2022-06-17T07:08:05Z","snapshot_observed_at":"2026-08-06T08:36:41.986484Z","submitted_at":"2021-10-13T08:33:31Z","title":"Decision Attentive Regularization to Improve Simultaneous Speech Translation Systems","version":2},"cited_work":{"arxiv_id":"2110.15729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.15729","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decision attentive reg- ularization to improve simultaneous speech translation systems","venue":null,"work_id":"82e9058e-9ddd-4a5c-8997-069a08356f77","year":2021},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2110.15729","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:1185859d69e67c337481632f8d8a643fa680823919bfc6ab265f39c0466d3912","observation_id":"b12c2c22-b541-4d44-99e0-b69b290bb478","resolution":{"observed_at":"2026-05-18T16:31:36.847157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross attention augmented transducer networks for simultane- ous translation","venue":null,"work_id":"3ae2fe61-e827-4465-a3a1-f9c655869e76","year":2021},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:01be83901db44c856e26912fdcda44126bce808f9aef2187c005d3bcb522a905","observation_id":"f1d534ab-5f6f-4389-b757-8df64a980a76","resolution":{"observed_at":"2026-05-18T16:31:37.952525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11379","last_updated":"2023-09-20T14:59:06Z","snapshot_observed_at":"2026-07-06T16:21:17.180009Z","submitted_at":"2023-09-20T14:59:06Z","title":"Incremental Blockwise Beam Search for Simultaneous Speech Translation with Controllable Quality-Latency Tradeoff","version":1},"cited_work":{"arxiv_id":"2309.11379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11379","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Incremental blockwise beam search for simul- taneous speech translation with controllable quality-latency tradeoff","venue":null,"work_id":"bc71230a-7638-4eb7-9c3e-c98d8656e202","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2309.11379","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:2b52aceefc4156d217bc14f10cbcfe9b561451f412dbeb3d196a8da0acc4026a","observation_id":"25dbe68d-7a18-42e0-ae39-7bce12e87ed0","resolution":{"observed_at":"2026-05-18T16:31:36.836102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention as a guide for simultaneous speech translation","venue":null,"work_id":"6d144e2b-bd07-46b9-9dd2-10e6c0717a8c","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:e50d39a9262f2efd7bcdee695143f9896e51f203c3ba087b4ab5255687309efc","observation_id":"bfe18e1a-eb72-417e-8548-7c9c41e6a4b9","resolution":{"observed_at":"2026-05-18T16:31:37.945992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:2996c3d52e837627d3c763aac61bdbe184723af3e875247e07f21613d0992394","observation_id":"dd84d51e-7157-4d6f-a6f6-17f81ad08e06","resolution":{"observed_at":"2026-05-18T16:31:36.817162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.13289","doi":"10.1016/j.ajhg.2009.06.010","metadata_source":"pith","pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","venue":"cs.SD","work_id":"b06d6def-ea7a-4cbd-8bb3-73f6a81db238","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:8072ebd7db0672ff9f711ac25960f3d9567311c2290f06b567780aa0e19c7e40","observation_id":"dad0e699-91aa-4189-9fd3-e402380beab9","resolution":{"observed_at":"2026-05-18T16:31:36.829565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:bb657bc8ace53224be803c91dbb6a92d2dd65f20665df1752ed1ff7e76adbea3","observation_id":"24cce4b3-79af-445d-9dcd-fb45577f3dec","resolution":{"observed_at":"2026-05-18T16:31:36.857609Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:a079e1a0145a0a1d3859bbef19654d4f9bb8b0d31a55e0e69940e6afa4114954","observation_id":"68f794ce-c0db-41c7-84ec-95c5ff9184f5","resolution":{"observed_at":"2026-05-18T16:31:36.811496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alignsum: Data pyramid hierarchical fine-tuning for aligning with human summarization preference","venue":null,"work_id":"5948474c-76c1-4011-ad34-4f8ac0069efd","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:6df86bed8189e10e4600e893570590a2e5463222544e9ccb74e57c50175076a8","observation_id":"dccab124-2081-4da8-a6c9-7aef4a5e5b57","resolution":{"observed_at":"2026-05-18T16:31:37.959778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A generalization of the beta distribution with applications.Journal of Econometrics, 66(1-2):133–152","venue":null,"work_id":"9c99750f-a1ff-493e-98a9-1ab527255eb0","year":1995},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:c6f016bff5ae255fe1afe639ba713560e1c431e182d849ae299dee5c24b9d4b5","observation_id":"ed27091e-7587-41cb-9ab0-3eb6594f678d","resolution":{"observed_at":"2026-05-18T16:31:37.956392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast infer- ence from transformers via speculative decoding","venue":null,"work_id":"04d187e8-765c-4204-bbb9-d9442539502f","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:7d5d826788c42765dd251f215672640fcda4fad9503914a47cbe7ce0c058da73","observation_id":"a0b788c3-36ca-41ae-8cef-57088ee23901","resolution":{"observed_at":"2026-05-18T16:31:37.942974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-01T17:44:35.425095Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":"2007.10310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-07-04T20:30:07.211214Z","title":"Covost 2 and massively multilingual speech-to-text translation","venue":null,"work_id":"6c9bffaf-0bd1-4fa9-ac70-56e01e042f08","year":2007},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:29e706f6869693899f39ec6a9eee05613f28e005f11da40de99a3ac1d6184614","observation_id":"875d1873-ea61-4487-9dbe-57d79dfc656e","resolution":{"observed_at":"2026-05-18T16:31:36.805785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:6cdf346235899439908ad85750d3b5b60137b630721224dfafb591edb2dc2e54","observation_id":"9d2b1a91-b90d-4eee-b643-2644c93f22e5","resolution":{"observed_at":"2026-05-18T16:31:36.852025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:37:02.032120Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"3767906b-1763-489b-9cad-ef5ce131c855","year":2002},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:490e2d09e64da721b9fd44ca1755c446f15ca4b4d7aef59621154190ab18ecdd","observation_id":"3aecd6b4-c54f-439b-9159-5802e76e9c34","resolution":{"observed_at":"2026-05-18T16:31:37.936665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xcomet: Transpar- ent machine translation evaluation through fine-grained error detection.Transactions of the Association for Computational Linguistics, 12:979–995","venue":null,"work_id":"9055dd0b-9835-4842-bbb4-075836e8d912","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:a6f3dc1d12b32f2669acef48011448b9150374af2fac38762565d5d8feefc550","observation_id":"5643e2c3-670f-4397-9b32-9885366aefdd","resolution":{"observed_at":"2026-05-18T16:31:37.940011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":14},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2509.15692."}