{"as_of":"2026-08-21T15:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6aedda77023086610eb00a3e647a652168bc42fe57605f5fc68e451a2e013c24","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:36:00.786445Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:35:57.016869Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T07:11:53.109624Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10299","snapshot_observed_at":"2026-08-07T04:35:57.016869Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.016869Z"},"links":{"cited_paper":"/paper/2506.10299","citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:3c0458aff5d03fc32fa4154f1741b743691224f2c5ebe774ba064139013c1869","observation_id":"0c67365c-715a-4f4d-a9cb-6e9e61eb62f5","resolution":{"observed_at":"2026-08-07T04:35:57.016869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"cited_work":{"arxiv_id":"2506.10299","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10299","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InProceedings of the Seventh Conference on Machine Translation (WMT), pages 46–68, Abu Dhabi, United Arab Emirates (Hybrid)","venue":null,"work_id":"11d84e7d-0e53-4e62-9aa9-97658fd11a99","year":2025},"citing_paper":{"arxiv_id":"2604.16287","last_updated":"2026-06-10T15:16:35Z","snapshot_observed_at":"2026-08-11T11:31:25.288207Z","submitted_at":"2026-04-17T17:49:46Z","title":"NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T07:11:32.500279Z"},"links":{"cited_paper":"/paper/2506.10299","citing_paper":"/paper/2604.16287"},"observation_digest":"sha256:d99aa88cd70913ef94fb213663aabf89616bcdd0c53f8aec51564b8e9dbd8c45","observation_id":"5532afef-ec45-4110-992d-3bf948ad7354","resolution":{"observed_at":"2026-05-10T07:11:53.111298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10299/citation-record","integrity":"/paper/2506.10299/integrity","json":"/paper/2506.10299/citation-record.json","paper":"/paper/2506.10299"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10299","snapshot_observed_at":"2026-08-07T04:35:57.016869Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.016869Z"},"links":{"cited_paper":"/paper/2506.10299","citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:3c0458aff5d03fc32fa4154f1741b743691224f2c5ebe774ba064139013c1869","observation_id":"0c67365c-715a-4f4d-a9cb-6e9e61eb62f5","resolution":{"observed_at":"2026-08-07T04:35:57.016869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.216502Z","title":"Speech-to-speech translation (S2ST) End-to-end speech-to-speech translation (S2ST) systems have been actively studied, which is jointly optimized as a speech-to- speech task [2–9]","venue":null,"work_id":"c59593c7-61ad-46a8-935a-52d1b7af0f51","year":null},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.058314Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:b6c9ecb58682024da27865958c0da32ae125c95c8caaf9c80982cc49f249aa28","observation_id":"201aee1b-781f-40e8-ac1a-d16ca8846b8d","resolution":{"observed_at":"2026-08-07T04:36:03.223466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.197986Z","title":"Speech-to-speech translation system As shown in Figure 2, we adopt a speech-to-speech translation (S2ST) system fine-tuned from an LLM, as in AudioPaLM [7]","venue":null,"work_id":"91cf8bf1-ad9b-4475-b6ed-f42343b2ea4c","year":null},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.099122Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:fb6369dd1980e3cd3999452a224a5a2f55ca099fe332bbf4efecad1c29041818","observation_id":"4277612b-a8d2-4dfc-92b8-82741556f477","resolution":{"observed_at":"2026-08-07T04:36:03.203017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.179087Z","title":null,"venue":null,"work_id":"a6625829-3200-40f3-b57f-f297911aa4c8","year":null},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.154368Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:dc6e77ba1e35d7f595162fa2563142f123be6ff117d9bd378e15added22eae05","observation_id":"e6072cdc-72ec-4206-af51-5341a59ebcb4","resolution":{"observed_at":"2026-08-07T04:36:03.183586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.162868Z","title":"The CVSS corpus is a widely used corpus for multilingual S2ST, built by speech synthe- sis from the CoV oST2 [36] speech-to-text translation corpus","venue":null,"work_id":"59b4e446-6ca9-43ff-bf56-2c37e974cef6","year":null},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.229801Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:1045f406a442d04aa9b2ddb2d92cfb175271867d257a077c4801985ffcfb3c7b","observation_id":"29a1df17-1875-4cf4-b0f5-c04bf5000bd2","resolution":{"observed_at":"2026-08-07T04:36:03.168690Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.139339Z","title":"We use interleaved speech–text units as the input and output of LLM, instead of the speech units, during fine-tuning LLM","venue":null,"work_id":"4b751fb0-276c-4810-84e6-f19e8d776f8a","year":null},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.293763Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:411e524ba410af4aeb54e4306c80bcb216e7e9cd351be448274a1c32c0bb3577","observation_id":"5b6d84b8-286b-42c8-8a83-10bcb2e5469e","resolution":{"observed_at":"2026-08-07T04:36:03.145119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.121306Z","title":"The ATR multilingual speech-to-speech translation system,","venue":null,"work_id":"f1d50bd8-3366-47a6-a263-57b218885739","year":2006},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.392935Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:b52fddf80847164bc9233bad48066c77dcaca81d71bc5d1b4ac8bde9e95338e4","observation_id":"73674bb9-7054-462b-8acb-996cc960ecfb","resolution":{"observed_at":"2026-08-07T04:36:03.126804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.083188Z","title":"Direct speech-to-speech translation with a sequence- to-sequence model,","venue":null,"work_id":"d2d7aac4-368c-4b2c-9521-4f29c540646a","year":2019},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.443833Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:f66179c0da9145fae9d32afccc62825fe92c8eddc2cf46fe1a7a2a34ce8bce55","observation_id":"6f79be64-ec0e-480b-8638-c10156d67053","resolution":{"observed_at":"2026-08-07T04:36:03.106380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.061830Z","title":"Trans- latotron 2: High-quality direct speech-to-speech translation with voice preservation,","venue":null,"work_id":"9b2a723b-63ff-4d14-8710-d3729e19effb","year":2021},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.557627Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:3432156a77a7c6c03fb6fc38458fd6061f28ca6648fbdf3afaa2257735726ec9","observation_id":"db1f0174-f87b-443f-b0ef-a8640d38851a","resolution":{"observed_at":"2026-08-07T04:36:03.070103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.045427Z","title":"Direct speech- to-speech translation with discrete units,","venue":null,"work_id":"db0da2b5-0188-4a29-8e2d-2505bac2dd30","year":2022},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.593692Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:9bd422ac54c2e08dcf00ad68b4a25348ac1a6dcb9e1a32b20dd3992fae132239","observation_id":"ad958d3a-8311-4ff3-bb1a-66ca0925185c","resolution":{"observed_at":"2026-08-07T04:36:03.049986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.026557Z","title":"UnitY: Two- pass direct speech-to-speech translation with discrete units,","venue":null,"work_id":"3eeeb135-ee3f-488c-9f2d-f1e586e0ead5","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.691384Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:d6b3d60a29729c262a454193e13bfc7410eed879aba664ebdb391dcf392ce4c5","observation_id":"50be0966-0b4c-4b07-8434-4417e400eb88","resolution":{"observed_at":"2026-08-07T04:36:03.032451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:03.008569Z","title":"SeamlessM4T: Massively mul- tilingual&multimodal machine translation,","venue":null,"work_id":"d611939c-884d-482d-942e-8041cd46c565","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.772800Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:5024a7c5c416001eb5d0ef9de7ed526adff861ad53695a4abb7e2f119f0a72fc","observation_id":"8f2a3717-4052-46c7-855c-62ccf491932c","resolution":{"observed_at":"2026-08-07T04:36:03.014533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.793044Z","title":"AudioPaLM: A large language model that can speak and listen,","venue":null,"work_id":"c41c6692-3eaa-4bb8-b395-385714812ea9","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.882107Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:0d42b7b1eb061c93bdd14b9fcd244cc17b38ea86571093329dd86f74be58999d","observation_id":"42335768-8cee-481f-a316-74ac65f2a976","resolution":{"observed_at":"2026-08-07T04:36:02.910716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.647675Z","title":"PolyV oice: Language models for speech to speech translation,","venue":null,"work_id":"070af91c-8c32-4d87-993e-abaa60e2a980","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:57.936105Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:43fc4f8905dd42d19c96bc70f4d0a06ae7e1cc1cb09b889573efeee6d5c1fbe4","observation_id":"0d9a00c6-1051-476a-bb3a-d9488c89ec48","resolution":{"observed_at":"2026-08-07T04:36:02.669830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.609922Z","title":"MSLM-S2ST: A multitask speech language model for textless speech-to-speech translation with speaker style preserva- tion,","venue":null,"work_id":"0ac2e910-e473-41a7-b8a7-879e34404b21","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.051680Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:71722257d11e6378106e80a5d833ae61821e4f6afb92f97ff980be289991387a","observation_id":"dc4a533c-2a14-457a-a9cf-3f9722ce4c60","resolution":{"observed_at":"2026-08-07T04:36:02.616522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.592468Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"d99146b7-ead2-4fa1-91e9-baa5ecad86c0","year":2021},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.123290Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:479505d5785bc5858ae5ba98d50cefd84a2207686d06393da72a01f17d94c176","observation_id":"213bbfb2-9406-4881-ae48-23092541654c","resolution":{"observed_at":"2026-08-07T04:36:02.598378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.574639Z","title":"w2v-BERT: Combining contrastive learning and masked language modeling for self-supervised speech pre- training,","venue":null,"work_id":"64c0750e-21eb-4a74-870c-3748c98386b1","year":2021},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.232629Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:cf451cec14d627b559777a83c45ba114879748af2b643590408ea9812b4b5c31","observation_id":"8cf1f694-4944-4e25-a4e9-d4ddc3a0b0df","resolution":{"observed_at":"2026-08-07T04:36:02.580959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.552246Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"c259bc91-ce41-40dc-b8f2-58812a6cd525","year":2021},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.296214Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:367b74a9ebbdc8c1e6a5f9369b545fd5cb921af76be15fc5c467c3798bdf2aaa","observation_id":"bd4740d8-e80e-48d8-87c8-a2829e247d6c","resolution":{"observed_at":"2026-08-07T04:36:02.558873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:58.376350Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.376350Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:30c20bd1f3c5899e7b5cb36f6b6991f54f91758d9fb1d07fae27ff608579672c","observation_id":"f33f6157-a8ab-448b-bdf8-c0aa3a4ed88a","resolution":{"observed_at":"2026-08-07T04:35:58.376350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.515074Z","title":"Language models are few-shot learners,","venue":null,"work_id":"ded8a206-13d9-4c41-850a-d14ac5027ca2","year":2020},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.481581Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:5468c440d1b955afa0443f8382d7dc6c7bff6ae761828af08a0a84482e6a095f","observation_id":"3079b3e6-108e-46bf-a7cf-1d20af200453","resolution":{"observed_at":"2026-08-07T04:36:02.521050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.492465Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":"46769651-ec94-4da3-97ee-9d9ce7f0d6d4","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.594113Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:f003d9fc9654a990dd3e78e94507e4b73b86150dae8aad8a7d8d938f2a26f0cd","observation_id":"9882ea6b-851b-4660-b8c2-53fafa7a4a02","resolution":{"observed_at":"2026-08-07T04:36:02.498520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.474969Z","title":"SLM: Bridge the thin gap between speech and text foun- dation models,","venue":null,"work_id":"88826056-8eb7-4603-91c4-5b59244a58af","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.689948Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:510edbe2120b6b8bd389ba99d8a47ff8fd7cf79370d6a9cba1b989989791deb8","observation_id":"75ca9f52-f304-4fc7-b7e6-e728ac618b7c","resolution":{"observed_at":"2026-08-07T04:36:02.479961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.456747Z","title":"On decoder-only architecture for speech-to-text and large language model integration,","venue":null,"work_id":"a92ee3a8-5f1a-481d-a29f-227c1e452f1b","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.762763Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:6d860460497c1cf5f641062eb52b53c5e58b9eef6e2e1ca51df2ff15a61b568a","observation_id":"41737303-affc-4460-86a2-7eb37e006e1e","resolution":{"observed_at":"2026-08-07T04:36:02.462356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.439209Z","title":"V oxtLM: Unified decoder-only models for consolidating speech recognition, synthesis and speech, text continuation tasks,","venue":null,"work_id":"b09d3ae5-a308-4e7e-907f-901534be5c71","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.847398Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:b63de9906233e2eb339522e4fcba8f08dc2f1a34508e76c48024330b7ee133e2","observation_id":"63102fb5-df9e-46ad-b8f1-cfe2e5323c48","resolution":{"observed_at":"2026-08-07T04:36:02.444074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.422536Z","title":"Qwen-Audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":"cc9ec7ff-4296-42fc-ab42-75b0a2d6470c","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:58.922240Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:80b43e06241539e54df88aa4885128834fef075dd9962f2e0375b4159ce6784f","observation_id":"a6619f27-2a8f-4112-b20b-547c52b1d9e1","resolution":{"observed_at":"2026-08-07T04:36:02.427769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.404251Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"6397a414-7b14-4b19-8c89-92ecbe27a7e7","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.005127Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:3bf267229fdf6fa40549bf66bc0bb9a31323d9f342b7714947111b0993dc0eab","observation_id":"efd7679b-354e-4eed-b0f1-8d48a8138c50","resolution":{"observed_at":"2026-08-07T04:36:02.409782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.385424Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"49b96ed9-abfa-4d70-8d6d-336b033147fa","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.070034Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:7c6fbdf84d083a6a987d432e1abb4cf8403e8e29152a487a30c427f5d8dd138e","observation_id":"7e7c0c7e-ac86-4bc7-afe0-eda957170126","resolution":{"observed_at":"2026-08-07T04:36:02.390320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.367349Z","title":"PaLM 2 technical report,","venue":null,"work_id":"fd3f8392-5e69-4358-9f1b-7a897437a2bf","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.161674Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:9821410a81913fe73c62b28d694d2cda3e7ba7ac679797e36c7ebc6add881621","observation_id":"2d787354-2c2d-4963-a1d9-cd376e6fdb64","resolution":{"observed_at":"2026-08-07T04:36:02.373985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.348229Z","title":"Bridging the modality gap for speech-to-text translation,","venue":null,"work_id":"20bb00f8-d5f0-40fd-88b0-994705faaa45","year":2020},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.240096Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:d8105e7b1f50bf7eec041f93978f583439d6e5d8110295a7496e1760d49f203f","observation_id":"219889a7-ed25-4341-b034-a064555d5787","resolution":{"observed_at":"2026-08-07T04:36:02.354529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.329261Z","title":"Push- ing the limits of zero-shot end-to-end speech translation,","venue":null,"work_id":"abc04d09-7917-427f-a655-ff9cd38e1748","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.352544Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:9422cb249347d2684511e5de71469bb8fdcee4cf9e36330d9744e03afcb4ce03","observation_id":"39ab0872-e6e9-44f0-8922-88a87624cad7","resolution":{"observed_at":"2026-08-07T04:36:02.334713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.313944Z","title":"SpiRit-LM: In- terleaved spoken and written language model,","venue":null,"work_id":"1b5113b3-cb4a-4f52-b24b-c2ced9933c26","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.431515Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:be3727761c7245504ca5bd8f41f29cec463dada28eaedd42639c374d5ba1e63f","observation_id":"522090b3-3d5d-42f8-a843-51af0e8f6b53","resolution":{"observed_at":"2026-08-07T04:36:02.318937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.295794Z","title":"The llama 3 herd of models,","venue":null,"work_id":"45f376fa-e065-4abb-bd6b-422cf4803af2","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.527407Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:5b48470e7d20cd0e9e6ac7448416f67cf49ad9ec81e33cda380c466dc7bb5d29","observation_id":"00aafe0a-508e-4e80-a1e1-9eb84e955021","resolution":{"observed_at":"2026-08-07T04:36:02.300516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.280246Z","title":"CVSS corpus and massively multilingual speech-to-speech translation,","venue":null,"work_id":"8471c292-a8d6-46f7-8c06-b95889e27ad1","year":2022},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.635644Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:f396536b08e23cd9178ba4e3f5abb18e50d147200cfee3fed54c5d77884fd134","observation_id":"f2d33f73-62c6-4ba6-85e0-f8aa3f2866de","resolution":{"observed_at":"2026-08-07T04:36:02.284842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.263050Z","title":"Speech resynthesis from discrete disentangled self-supervised representations,","venue":null,"work_id":"5cad1f0f-e1fd-4bdc-96de-6004c8e70469","year":2021},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.703342Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:49393ba0cfe5f325c514a4bae264516fc9e2d61c28c1969b8fce0c3c3267da3a","observation_id":"0ecd7193-bc8e-4457-a050-0ce6ad047006","resolution":{"observed_at":"2026-08-07T04:36:02.268446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:59.801777Z","title":"HiFi-GAN: Generative adversar- ial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.801777Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:b5d22977958418bca3294087430b8d4a61fbf01dea14cd59bdb50d1f2ea50681","observation_id":"08d467e9-3a37-48fc-a5fe-0a1611504a52","resolution":{"observed_at":"2026-08-07T04:35:59.801777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.234225Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"f61c98ba-b38c-4157-acce-adca09da8ac9","year":2021},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:59.907749Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:8df96eb86a5c5698c320b93b6063b36b2daafa08abd74c85f5fa82eff94cd0eb","observation_id":"8d92952c-a5af-4fbd-841a-cc4c449d59cf","resolution":{"observed_at":"2026-08-07T04:36:02.238915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.218217Z","title":"AudioLM: A language modeling approach to audio generation,","venue":null,"work_id":"d7e33708-0ca0-420c-b8c4-72e4d097a5c3","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.019228Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:8d591e430320f21e6ac409b563bd064659ae44c359d19aab8795d1c78f1529fc","observation_id":"e970c5ac-a21b-4d8a-9a40-19c348d83ccc","resolution":{"observed_at":"2026-08-07T04:36:02.222869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.203205Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"020f9503-7ac1-4079-a7c0-3cd2020339dd","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.112987Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:3606c4064c0f491e1d6ca108b9e4ba3b76d9aaee30571e2e0b06c50a189aa9ad","observation_id":"b251883f-ff82-4bbe-bb97-bb4c961be324","resolution":{"observed_at":"2026-08-07T04:36:02.207684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.185484Z","title":"Speak for- eign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":"a6216f16-9126-428b-9670-a7fc261155d6","year":2023},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.165920Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:d2f931f69201fb0e7d47c6c55e3cad4c68778cf50b9f0bc4b78ff362b48f05d7","observation_id":"d2cfee65-97ea-4016-9dc8-b5575ccb51d0","resolution":{"observed_at":"2026-08-07T04:36:02.190651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.166196Z","title":"Scaling speech-text pre-training with synthetic interleaved data,","venue":null,"work_id":"b31104c4-9450-4c6e-87d6-cb0f58587849","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.295306Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:ee15c6cd233be62926f131861567a52dd0826da2fc99b5e02a3a47420015253a","observation_id":"8e895d53-15e0-4fe5-b322-049f26681bcf","resolution":{"observed_at":"2026-08-07T04:36:02.170997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.144026Z","title":"CTC-segmentation of large corpora for german end-to-end speech recognition,","venue":null,"work_id":"b9d906de-782f-48d4-a655-950328a6b23e","year":2020},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.370584Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:6ad1fca1767ce180e32702d54674b24fe03b4814e07ab338f7285320fdcd5caf","observation_id":"1ab6d6e6-20eb-4abe-a7b2-8c5e65cb6062","resolution":{"observed_at":"2026-08-07T04:36:02.151621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:02.091065Z","title":"CoV oST 2 and massively multilingual speech translation,","venue":null,"work_id":"967274f4-60f2-4ada-907e-f653b792e521","year":2021},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.470798Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:b776792be7ed3279f57b9c5f0b25b36970e2b5f9e4504d06e009dd1a96945b8f","observation_id":"4f54195b-4f99-48a7-b2ba-12aed8b44562","resolution":{"observed_at":"2026-08-07T04:36:02.127549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:01.827671Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"7be11722-e724-4bf5-990d-ecf152185140","year":2018},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.567759Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:db4060bce433799e2d7e6e0c91d628a98b74bb1b99f0d6cc7a29033a3c75236f","observation_id":"1310da3b-42f6-487b-8c1d-6c1901b54136","resolution":{"observed_at":"2026-08-07T04:36:01.944452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:01.515205Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"1384dd2e-d914-4b0d-8921-372f0f72b301","year":2022},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.682970Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:d2c00e380cc2880ebc9aa292a7ff9b0b5155f948d43fb17fbf9e06aa1ea225b1","observation_id":"6624793d-9b5a-4b8f-ae3e-36b306871312","resolution":{"observed_at":"2026-08-07T04:36:01.711048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:01.240057Z","title":"UTMOS: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"003a0294-1601-4665-80f4-586e553c7d3e","year":2022},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.775392Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:c92ad6b62aaf7497773193406e9714eacde69ff6e8aa8484147fdd2825f26b44","observation_id":"f1a8bf44-a61b-4888-8541-80c4cde1c945","resolution":{"observed_at":"2026-08-07T04:36:01.329064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:36:00.956378Z","title":"Investigating decoder-only large language models for speech-to-text translation,","venue":null,"work_id":"16834e70-355f-4a3c-9044-f8c369af375f","year":2024},"citing_paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:36:00.786445Z"},"links":{"citing_paper":"/paper/2506.10299"},"observation_digest":"sha256:fe70b35fabfd1caaac53300e03ac537cc3b69f45695069fbfb1711ea2094b1df","observation_id":"d6b071d8-822d-40b2-9a08-1456c7190136","resolution":{"observed_at":"2026-08-07T04:36:01.089859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10299","last_updated":"2025-06-12T02:24:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T04:27:27.893596Z","submitted_at":"2025-06-12T02:24:44Z","title":"Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2506.10299."}