{"as_of":"2026-08-11T08:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc8b70b1fe77097982a13cd8fa1285da8201a83dff74eb39932ae7da6ba93417","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":76,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:12:12.112077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":41,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-11T05:12:12.112077Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17908","last_updated":"2025-04-21T18:58:16Z","snapshot_observed_at":"2026-08-11T05:06:30.288148Z","submitted_at":"2024-12-23T19:04:46Z","title":"Trading Devil RL: Backdoor attack via Stock market, Bayesian Optimization and Reinforcement Learning","version":3},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:12.112077Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2412.17908"},"observation_digest":"sha256:5114f7d2f9b2b4507ba8fd5f0cbcf900e3baefd9f9f0f474831da4dd304cc261","observation_id":"af4d82ac-6a48-4016-9d33-e7810527851f","resolution":{"observed_at":"2026-08-11T05:12:12.112077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-11T04:45:04.446640Z","title":"arXiv preprint arXiv:2312.05187","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18495","last_updated":"2024-12-24T15:26:31Z","snapshot_observed_at":"2026-08-11T04:39:20.649486Z","submitted_at":"2024-12-24T15:26:31Z","title":"How \"Real\" is Your Real-Time Simultaneous Speech-to-Text Translation System?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:04.446640Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2412.18495"},"observation_digest":"sha256:4bd8f089c9a31b6e5b26f9215887614d3f216a561a0f8c1e2561c02ae069f62a","observation_id":"8f5c02d6-c97e-4a85-9161-d221f8354af9","resolution":{"observed_at":"2026-08-11T04:45:04.446640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-10T23:28:04.157974Z","title":"arXiv preprint arXiv:2312.05187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20359","last_updated":"2024-12-29T05:30:06Z","snapshot_observed_at":"2026-08-10T23:21:31.444039Z","submitted_at":"2024-12-29T05:30:06Z","title":"EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T23:28:04.157974Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2412.20359"},"observation_digest":"sha256:f29ed115dba3bf9370b1ee687614d961bd618bab42471965181f0340480f7e6f","observation_id":"15670c3a-ba8f-4be6-aee4-b1d914f7afee","resolution":{"observed_at":"2026-08-10T23:28:04.157974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-10T21:10:24.764561Z","title":"Seamless: Multilingual expres- sive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05989","last_updated":"2025-01-10T14:20:46Z","snapshot_observed_at":"2026-08-10T21:56:23.143933Z","submitted_at":"2025-01-10T14:20:46Z","title":"Addressing speaker gender bias in large scale speech translation systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:24.764561Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2501.05989"},"observation_digest":"sha256:34491f6dde43f3ea668da20ba4a4c1278fc9b42f79b38d4e0771ebf873a50d95","observation_id":"9bae3ad8-329a-4835-a9ec-4a62ecd9315c","resolution":{"observed_at":"2026-08-10T21:10:24.764561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-10T20:27:22.440781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16344","last_updated":"2025-05-31T16:37:32Z","snapshot_observed_at":"2026-08-10T20:19:27.664864Z","submitted_at":"2025-01-15T06:30:17Z","title":"WhiSPA: Semantically and Psychologically Aligned Whisper with Self-Supervised Contrastive and Student-Teacher Learning","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:27:22.440781Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2501.16344"},"observation_digest":"sha256:b5d6465fcbb3f1487493a08505ae7bb32e0452eaafce251fb607f55c8635033e","observation_id":"7b44b743-b89c-4310-a8b2-d64a3a4eee3f","resolution":{"observed_at":"2026-08-10T20:27:22.440781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-09T19:17:55.392128Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00374","last_updated":"2025-02-01T09:24:32Z","snapshot_observed_at":"2026-08-09T19:12:21.174858Z","submitted_at":"2025-02-01T09:24:32Z","title":"A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:17:55.392128Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2502.00374"},"observation_digest":"sha256:9ed2da1de7646df9f6dec709d79494a0462c561c4076cf63effa8c3fb8d7ea0d","observation_id":"6438701b-a5ec-4a37-abf9-f6a4f3844d0a","resolution":{"observed_at":"2026-08-09T19:17:55.392128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-09T05:01:56.004378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-11T08:04:13.200079Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T05:01:56.004378Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2502.03382"},"observation_digest":"sha256:e6bc6550dbb551c67db329f402ff722956de2d9a469b4479635342aaaf21c209","observation_id":"db04918e-1588-4b62-94e2-e2ab7ccfb8f7","resolution":{"observed_at":"2026-08-09T05:01:56.004378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-08T23:29:25.829951Z","title":"Barrault, L., Chung, Y .-A., Meglioli, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T23:29:25.829951Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2502.04128"},"observation_digest":"sha256:708375aa1d59ebb37da7a671bd59771edd1cad7e3ea6064da9668816adde4583","observation_id":"fb740150-cfe6-42f7-abdd-edf326726cb4","resolution":{"observed_at":"2026-08-08T23:29:25.829951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T18:32:13.574777Z","title":"C., Dale, D., Dong, N., Duppenthaler, M., Duquenne, P.-A., Ellis, B., Elsahar, H., Haaheim, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10373","last_updated":"2025-02-14T18:51:40Z","snapshot_observed_at":"2026-08-11T08:35:03.220189Z","submitted_at":"2025-02-14T18:51:40Z","title":"OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:13.574777Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2502.10373"},"observation_digest":"sha256:e85a096dcbe71600e56e447117a7adcb5ddc12e1a52f5f87759198090afafd7f","observation_id":"616006b8-a807-4b2e-a31f-151df3c44c06","resolution":{"observed_at":"2026-08-07T18:32:13.574777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2504.01919","last_updated":"2026-01-12T12:46:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T17:26:40Z","title":"Bridging the Linguistic Divide: A Survey on Leveraging Large Language Models for Machine Translation","version":4},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-22T21:38:29.497183Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2504.01919"},"observation_digest":"sha256:70b1e45b572a67aac60e4be017334ce9c47cb158c74c6adf8ccc51abacd5f691","observation_id":"237bd786-7a1b-4f89-b000-8c1889add4aa","resolution":{"observed_at":"2026-05-22T21:42:11.401276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T15:14:32.771868Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15773","last_updated":"2025-05-21T17:25:27Z","snapshot_observed_at":"2026-08-07T15:09:42.896411Z","submitted_at":"2025-05-21T17:25:27Z","title":"ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:32.771868Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.15773"},"observation_digest":"sha256:18e945b1f45a6dd415bc22a248da5dc37d7259e47b6c14232c961701782835c6","observation_id":"66071322-9757-4aa5-b7b7-669446609592","resolution":{"observed_at":"2026-08-07T15:14:32.771868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T14:55:54.912281Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16972","last_updated":"2025-05-22T17:51:05Z","snapshot_observed_at":"2026-08-09T09:32:42.256193Z","submitted_at":"2025-05-22T17:51:05Z","title":"From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:54.912281Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.16972"},"observation_digest":"sha256:8be98b22c80e615673e1967dfe4a24764a031894617e6b344136da50418ded2f","observation_id":"851d97c0-f3eb-4d2c-b8c6-bb67bb7072d4","resolution":{"observed_at":"2026-08-07T14:55:54.912281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T14:49:28.537697Z","title":"Seamless: Multilingual expressive and stream- ing speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.537697Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:b4c10dcf57460e1b764f33689ea8e5d6f47b790fdd7efc768322bfc99819d255","observation_id":"f9c63014-3cb0-48d8-8af5-6f85d8fdbb59","resolution":{"observed_at":"2026-08-07T14:49:28.537697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T14:07:21.971099Z","title":"C., Dale, D., Dong, N., Duppenthaler, M., Duquenne, P.-A., Ellis, B., Elsahar, H., Haaheim, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:21.971099Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:d399e789805f378aa4db7caa4a47825773805fe8fc45996da6f859bcf83ab907","observation_id":"4c46a8f5-927f-4f61-8981-28f0fa111913","resolution":{"observed_at":"2026-08-07T14:07:21.971099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T13:56:29.523320Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20564","last_updated":"2025-07-12T04:42:21Z","snapshot_observed_at":"2026-08-10T13:40:31.184023Z","submitted_at":"2025-05-26T22:53:48Z","title":"The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:29.523320Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.20564"},"observation_digest":"sha256:09a9301999f4d952429e574a876c9a8c8c56af94665a185370115f1f85269c8e","observation_id":"6dbcbbbd-4370-4a97-9aba-c82c3a6a2db4","resolution":{"observed_at":"2026-08-07T13:56:29.523320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T13:57:10.263287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20622","last_updated":"2025-05-27T01:59:58Z","snapshot_observed_at":"2026-08-11T02:52:53.916057Z","submitted_at":"2025-05-27T01:59:58Z","title":"SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:57:10.263287Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.20622"},"observation_digest":"sha256:6a04d4794719a9a651b035a24f024ebdd5e05e97962a977798bf1093af536161","observation_id":"b43460e0-e64a-4507-9949-d9ba69f1826a","resolution":{"observed_at":"2026-08-07T13:57:10.263287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T13:42:54.912484Z","title":"arXiv preprint arXiv:2312.05187 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21230","last_updated":"2025-05-27T14:14:55Z","snapshot_observed_at":"2026-08-11T02:47:56.666671Z","submitted_at":"2025-05-27T14:14:55Z","title":"PSRB: A Comprehensive Benchmark for Evaluating Persian ASR Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:54.912484Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.21230"},"observation_digest":"sha256:71b512520929e518129d6d5c0b86550c3f5ce44a2212ca42e866897c3bad7b74","observation_id":"ff5e8b65-dc66-4d44-b1e0-7d44e285d4cb","resolution":{"observed_at":"2026-08-07T13:42:54.912484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T13:30:21.788261Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21781","last_updated":"2025-05-27T21:26:35Z","snapshot_observed_at":"2026-08-10T11:03:22.108963Z","submitted_at":"2025-05-27T21:26:35Z","title":"GMU Systems for the IWSLT 2025 Low-Resource Speech Translation Shared Task","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:21.788261Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.21781"},"observation_digest":"sha256:0d16e2dc09c9a410ce79c78f1c10425af0d0abfc0e5f3d1759b163897840afaa","observation_id":"30ea2ba9-1172-490f-ae57-4e5662940919","resolution":{"observed_at":"2026-08-07T13:30:21.788261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T12:26:47.266093Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24571","last_updated":"2025-05-30T13:23:46Z","snapshot_observed_at":"2026-08-10T18:36:03.130552Z","submitted_at":"2025-05-30T13:23:46Z","title":"Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:47.266093Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.24571"},"observation_digest":"sha256:07f3546d11b71c5cff5a9508125026235306e0f9173cc8a82ad5be71c0020a09","observation_id":"79a2e2f6-b622-4482-b707-70e9e8e0fc9c","resolution":{"observed_at":"2026-08-07T12:26:47.266093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T12:37:58.867229Z","title":"Seamless: Multilingual expressive and streaming speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00087","last_updated":"2025-05-30T05:54:46Z","snapshot_observed_at":"2026-08-07T12:25:49.461882Z","submitted_at":"2025-05-30T05:54:46Z","title":"SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:37:58.867229Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.00087"},"observation_digest":"sha256:df73986b0bde8483b6ec4c76dba85e0798ccc8e7c73025e1d7b7e2d68030b4cc","observation_id":"50be0880-8e66-45fc-97f8-da8b100ac724","resolution":{"observed_at":"2026-08-07T12:37:58.867229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T12:04:11.190594Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00748","last_updated":"2025-05-31T23:27:07Z","snapshot_observed_at":"2026-08-08T15:27:05.007258Z","submitted_at":"2025-05-31T23:27:07Z","title":"Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translations","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:11.190594Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.00748"},"observation_digest":"sha256:9fc1051a0fbf70c1cb7de7786a65c7df47e287efac3cf6a3370b17d6afdc5709","observation_id":"e3a921c1-e254-4f16-97f5-8c17d3bf56f9","resolution":{"observed_at":"2026-08-07T12:04:11.190594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T11:21:08.605193Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02742","last_updated":"2025-06-03T10:59:22Z","snapshot_observed_at":"2026-08-11T02:46:58.961268Z","submitted_at":"2025-06-03T10:59:22Z","title":"Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:08.605193Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.02742"},"observation_digest":"sha256:761364a387157af4459c8bc58ced7ffe86ad31332835a4ead881f1c866447fbb","observation_id":"6161839f-97d8-4820-b17f-79b608a8c284","resolution":{"observed_at":"2026-08-07T11:21:08.605193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T11:15:58.484341Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02995","last_updated":"2025-06-03T15:29:52Z","snapshot_observed_at":"2026-08-10T18:32:24.851514Z","submitted_at":"2025-06-03T15:29:52Z","title":"It's Not a Walk in the Park! Challenges of Idiom Translation in Speech-to-text Systems","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:15:58.484341Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.02995"},"observation_digest":"sha256:fa0db60ee01c9b1a46f28396681eb93bc29e911f9a830d6d681635d174a4694b","observation_id":"d0036907-2891-45ad-b5d5-0b56035ca3c8","resolution":{"observed_at":"2026-08-07T11:15:58.484341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T10:55:20.148186Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.148186Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:4590101d46fd41bab7a108628418e4ac6d505543d4e5b91b5fb598d59d3d2272","observation_id":"c9f3b311-7eea-48d9-9bb0-b849850a81b0","resolution":{"observed_at":"2026-08-07T10:55:20.148186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T23:48:37.233627Z","title":"Kao, Ann Lee, Xutai Ma, Alexandre Mourachko, Benjamin Peloquin, Juan Pino, Sravya Popuri, Christophe Ropers, Safiyyah Saleem, Holger Schwenk, Anna Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15981","last_updated":"2025-06-28T05:47:16Z","snapshot_observed_at":"2026-08-10T08:31:47.566066Z","submitted_at":"2025-06-19T02:56:49Z","title":"Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusion","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:48:37.233627Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.15981"},"observation_digest":"sha256:2335b116a681d44dc2d9374f2bd1e326fe9c49f8202a4b74062f795bcdac2f73","observation_id":"b40de9ad-a150-4fdc-8ab2-08f8dcfa8685","resolution":{"observed_at":"2026-08-06T23:48:37.233627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T23:34:06.852611Z","title":"arXiv preprint arXiv:2312.05187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.852611Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:1c9e47e00ba0d1a81a5f8b9c113523eb50ecf16408b874c6ba3066b76cb2eba5","observation_id":"8117339d-05be-41c1-85d4-dc3e9f67baea","resolution":{"observed_at":"2026-08-06T23:34:06.852611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T19:55:03.608406Z","title":"Seamless: Multilingual expressive and streaming speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.608406Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:8f6b46b30002e01eb9593d409ae233a8602fcaea9a3d2b27602b7f3716454cc2","observation_id":"39cf408f-2267-471a-813e-88f5f227bf17","resolution":{"observed_at":"2026-08-06T19:55:03.608406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T18:37:34.111997Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07803","last_updated":"2025-07-13T01:40:13Z","snapshot_observed_at":"2026-08-10T04:40:05.024874Z","submitted_at":"2025-07-10T14:28:39Z","title":"StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:37:34.111997Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2507.07803"},"observation_digest":"sha256:ec0d7bc8e63a05f42a5bfe7e619b2ef94bee2159816203d9d42ea334966b2180","observation_id":"d3dfb43f-ea9c-4f1d-a106-8ed571e35bf2","resolution":{"observed_at":"2026-08-06T18:37:34.111997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T14:52:42.956099Z","title":"Seamless: Multilingual expressive and streaming speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17527","last_updated":"2025-07-27T05:17:25Z","snapshot_observed_at":"2026-08-08T10:18:26.773169Z","submitted_at":"2025-07-23T14:07:41Z","title":"Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:52:42.956099Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2507.17527"},"observation_digest":"sha256:f47ba33627018d3376286ec4ba12bfadd877720a158328d16f7e561c237d9eb5","observation_id":"ec7eb0f9-ab53-4ee6-bd44-073d934ca742","resolution":{"observed_at":"2026-08-06T14:52:42.956099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T12:46:44.500438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21500","last_updated":"2025-07-29T04:48:55Z","snapshot_observed_at":"2026-08-08T03:32:53.516422Z","submitted_at":"2025-07-29T04:48:55Z","title":"VN-MTEB: Vietnamese Massive Text Embedding Benchmark","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T12:46:44.500438Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2507.21500"},"observation_digest":"sha256:af85339c161cd886dae1a5815c91c58b7e630dff0ff79598e3e88973c1d75bc1","observation_id":"82e01ac4-351c-4ffe-8a4d-2934366cf7f1","resolution":{"observed_at":"2026-08-06T12:46:44.500438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T10:09:15.914528Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00537","last_updated":"2026-06-04T15:15:25Z","snapshot_observed_at":"2026-08-09T14:05:45.481857Z","submitted_at":"2025-08-01T11:24:12Z","title":"The Prosody of Emojis","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T10:09:15.914528Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2508.00537"},"observation_digest":"sha256:144a7b4dccdbd85051983571ff8fab5379251b039702697ce4fb5ba4209114c4","observation_id":"63998669-d7b1-46d9-8169-8bd0665d063d","resolution":{"observed_at":"2026-08-06T10:09:15.914528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T21:07:04.621533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.621533Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:3ba355b6e3823bb58c6309cf332189a465f81c18c8250ad5a3880bc4f086f3f7","observation_id":"629c8f73-b06a-4b22-b96e-9b67c73425ec","resolution":{"observed_at":"2026-08-05T21:07:04.621533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T17:06:13.588262Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17148","last_updated":"2025-08-23T21:49:27Z","snapshot_observed_at":"2026-08-08T10:14:27.572675Z","submitted_at":"2025-08-23T21:49:27Z","title":"Geolocation-Aware Robust Spoken Language Identification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:06:13.588262Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2508.17148"},"observation_digest":"sha256:f49ed1c5dcb3aa942edfdd307229557538b1c02f8dc89bbb3c6c3faa8dc81f84","observation_id":"09ff79f7-f56e-4818-b82a-14dd7a7c85e9","resolution":{"observed_at":"2026-08-05T17:06:13.588262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T15:39:21.280859Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19721","last_updated":"2025-08-27T09:30:43Z","snapshot_observed_at":"2026-08-10T02:36:26.862506Z","submitted_at":"2025-08-27T09:30:43Z","title":"CAM\\~OES: A Comprehensive Automatic Speech Recognition Benchmark for European Portuguese","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:39:21.280859Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2508.19721"},"observation_digest":"sha256:e42271c80552154ff963ef4e9ff464650ed79cb335d959cffb3a7b9165be304b","observation_id":"33b76601-05f0-4649-a81e-a99f6f0883b8","resolution":{"observed_at":"2026-08-05T15:39:21.280859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T15:22:20.585051Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00094","last_updated":"2025-08-27T15:28:46Z","snapshot_observed_at":"2026-08-05T15:22:19.865972Z","submitted_at":"2025-08-27T15:28:46Z","title":"Automatic Pronunciation Error Detection and Correction of the Holy Quran's Learners Using Deep Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:22:20.585051Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2509.00094"},"observation_digest":"sha256:f1957fcc42e765f3eeee4410d58aeb0289235dae5b60673d6db8b61e5bf74162","observation_id":"e0ef36f3-4ac7-42e1-8eb6-cd379d1c8086","resolution":{"observed_at":"2026-08-05T15:22:20.585051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T12:00:47.916052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02038","last_updated":"2025-09-03T22:50:00Z","snapshot_observed_at":"2026-08-09T07:50:29.608702Z","submitted_at":"2025-09-02T07:28:51Z","title":"NADI 2025: The First Multidialectal Arabic Speech Processing Shared Task","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T12:00:47.916052Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2509.02038"},"observation_digest":"sha256:e6c928d4bb0f26e38c640fc62a51e8ca05898bb788988fd5f18b3655ad319c2f","observation_id":"9bc5e83a-d93f-40bd-909d-dd5cff15bdaf","resolution":{"observed_at":"2026-08-05T12:00:47.916052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T10:16:04.849538Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04392","last_updated":"2025-09-04T17:03:58Z","snapshot_observed_at":"2026-08-09T12:04:37.130962Z","submitted_at":"2025-09-04T17:03:58Z","title":"Denoising GER: A Noise-Robust Generative Error Correction with LLM for Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:04.849538Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2509.04392"},"observation_digest":"sha256:43f769ea1fb7635b09c9cd1cb9f95bb07311478246e111c35605eb5581067ab3","observation_id":"5717e209-f013-4b6d-90b2-82114cc72974","resolution":{"observed_at":"2026-08-05T10:16:04.849538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T05:21:20.819131Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05634","last_updated":"2025-09-06T07:40:27Z","snapshot_observed_at":"2026-08-09T00:47:52.002336Z","submitted_at":"2025-09-06T07:40:27Z","title":"On the Contribution of Lexical Features to Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:21:20.819131Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2509.05634"},"observation_digest":"sha256:777917bb4033c2488850b29a11dbafb692d0f882b9a06f5d79ddcff5c3788f62","observation_id":"3e685189-5188-4e6d-b25d-2e0eaeddabad","resolution":{"observed_at":"2026-08-05T05:21:20.819131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T10:17:22.398113Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09701","last_updated":"2025-09-04T17:21:36Z","snapshot_observed_at":"2026-08-08T02:54:52.019617Z","submitted_at":"2025-09-04T17:21:36Z","title":"Optimal Multi-Task Learning at Regularization Horizon for Speech Translation Task","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T10:17:22.398113Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2509.09701"},"observation_digest":"sha256:239aee18517943fed7aac033a513d1477e46b9c35b466eb98ef03718e039243c","observation_id":"e4649a6e-8678-42f5-b023-fdafd2a84640","resolution":{"observed_at":"2026-08-05T10:17:22.398113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-03T00:57:00.966475Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.11072","last_updated":"2026-07-22T13:29:14Z","snapshot_observed_at":"2026-08-10T01:36:30.263980Z","submitted_at":"2026-02-11T17:41:01Z","title":"Simultaneous Speech-to-Speech Translation Without Aligned Data","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T00:57:00.966475Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2602.11072"},"observation_digest":"sha256:1fb63a7fb5bfc33d24aba47bd1184b0113cbcbeb42ee0774423cc78f89439b38","observation_id":"418ccc03-7c3c-45e2-92f8-f9f8ea3d7ded","resolution":{"observed_at":"2026-08-03T00:57:00.966475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-03T00:03:40.825775Z","title":"Preprint, arXiv:2312.05187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11933","last_updated":"2026-06-24T09:37:36Z","snapshot_observed_at":"2026-08-11T00:57:12.107021Z","submitted_at":"2026-02-12T13:30:12Z","title":"Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T00:03:40.825775Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2602.11933"},"observation_digest":"sha256:83a4606a3ebceaaa874634d38ba871d79c618729bb7880d3af6532882c0fbefd","observation_id":"c6a820ec-8067-4536-aa61-c6865d1513a3","resolution":{"observed_at":"2026-08-03T00:03:40.825775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2604.04598","last_updated":"2026-04-06T11:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T11:23:42Z","title":"Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:44:30.762851Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.04598"},"observation_digest":"sha256:c06f1d40cab428cc852f25fe3728aa016877fbbe822276a7c5814316ea7d4f46","observation_id":"cadf4a1d-ff1e-4eff-8a47-19514088bcfa","resolution":{"observed_at":"2026-05-10T22:35:48.711956Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2604.05830","last_updated":"2026-04-07T13:02:04Z","snapshot_observed_at":"2026-08-11T04:55:11.606408Z","submitted_at":"2026-04-07T13:02:04Z","title":"\"OK Aura, Be Fair With Me\": Demographics-Agnostic Training for Bias Mitigation in Wake-up Word Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:55:56.713141Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.05830"},"observation_digest":"sha256:7a95720810da81c9b7672da86b9fbf5d1d31df6ffa6a779e854acc33856de44a","observation_id":"59ea09d2-9d34-4f74-aa0a-62a6c3e0f26c","resolution":{"observed_at":"2026-05-10T23:40:53.652838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2604.09344","last_updated":"2026-06-30T08:43:15Z","snapshot_observed_at":"2026-08-11T03:46:03.423906Z","submitted_at":"2026-04-10T14:16:34Z","title":"DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:47:58.217280Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.09344"},"observation_digest":"sha256:6fe83c2d11d73bb6f9289ac493d8ef18afedf4637aa9a73cca95e6ebbead8734","observation_id":"b66f182e-ac22-428d-97ac-65388974cd4b","resolution":{"observed_at":"2026-05-11T06:05:59.059056Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2604.16287","last_updated":"2026-06-10T15:16:35Z","snapshot_observed_at":"2026-08-07T12:37:33.552132Z","submitted_at":"2026-04-17T17:49:46Z","title":"NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T07:11:32.500279Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.16287"},"observation_digest":"sha256:28791251652486d9eee383fa8d1d53cdcf73cda85b5eaa0a1b9ce199075e63ab","observation_id":"cacd9948-47fc-48db-8242-a2f87096caa5","resolution":{"observed_at":"2026-05-10T07:11:53.108467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2604.17435","last_updated":"2026-04-19T13:34:52Z","snapshot_observed_at":"2026-08-11T04:40:44.009247Z","submitted_at":"2026-04-19T13:34:52Z","title":"MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:36:07.090627Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.17435"},"observation_digest":"sha256:ca038eb4c70b203cd5b160d75397ef97b2644d78046acadfc4f228389d95f379","observation_id":"7f6d5090-705a-4231-aac5-8fb3eb72ef3d","resolution":{"observed_at":"2026-05-10T05:41:02.471102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2604.22467","last_updated":"2026-04-24T11:43:25Z","snapshot_observed_at":"2026-07-31T06:13:14.722604Z","submitted_at":"2026-04-24T11:43:25Z","title":"DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T09:18:53.285951Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.22467"},"observation_digest":"sha256:28f5bc4f13fcba080c92530173a5a80dac8961486acf1d6dadf2091eeb0eff3a","observation_id":"eed19b61-eade-457a-9af2-1887c7153432","resolution":{"observed_at":"2026-05-11T20:21:12.553074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:25c9b91a71f3d7622c28deb56d1c9155d2edde59d0a104a085f63da99fcbddd2","observation_id":"06d85084-87c1-42ae-b0b3-e2b7ba997c1e","resolution":{"observed_at":"2026-05-12T09:11:27.152485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-02T15:21:28.794596Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.794596Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:6e53cd470d0eefb309dd546879aec48a74b62094dc8058616151fb96abb12a07","observation_id":"756cc432-8472-4580-a337-dad97d50d64c","resolution":{"observed_at":"2026-08-02T15:21:28.794596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2605.10084","last_updated":"2026-05-11T07:05:11Z","snapshot_observed_at":"2026-08-10T22:46:07.622430Z","submitted_at":"2026-05-11T07:05:11Z","title":"PoDAR: Power-Disentangled Audio Representation for Generative Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:04:08.420600Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2605.10084"},"observation_digest":"sha256:6bf64b3898382d6318b76f358342b26a9584aaabd9eed0a60aac6ad9e3cb0bd5","observation_id":"e72b486e-93b3-4cf2-8330-0855f686fecf","resolution":{"observed_at":"2026-05-12T06:41:35.366926Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2605.11098","last_updated":"2026-05-11T18:04:33Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:04:33Z","title":"AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T01:04:54.506749Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2605.11098"},"observation_digest":"sha256:90144b6201e227028f4c68a0af2fbdbc4561343b9bd465d024abc63b9588bcdd","observation_id":"30ff1b09-6ce2-401d-8c9b-ba86950305c4","resolution":{"observed_at":"2026-05-13T01:07:00.315034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2605.31173","last_updated":"2026-05-29T11:38:38Z","snapshot_observed_at":"2026-08-06T11:15:32.236829Z","submitted_at":"2026-05-29T11:38:38Z","title":"MindVoice: Reconstructing Intelligible Speech from Non-invasive Neural Signals with Pretrained Priors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T21:08:39.636966Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2605.31173"},"observation_digest":"sha256:de20cba2de46feb407dcb32ed5497f97deb6f93c8eeb2ab8178aa5bc1cd6bc6f","observation_id":"87ec1725-7956-4b75-b2a5-e25ff2d67f63","resolution":{"observed_at":"2026-07-01T20:26:12.753138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.03241","last_updated":"2026-06-02T07:01:33Z","snapshot_observed_at":"2026-08-06T18:58:23.488249Z","submitted_at":"2026-06-02T07:01:33Z","title":"Benchmarking Speech-to-Speech Translation Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T10:34:10.510906Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.03241"},"observation_digest":"sha256:613169a1bd724ab5f7d0cac0f5015c4c26218b7efae68032e1eb98fcaa855ed0","observation_id":"7474c107-281c-44fb-9a4b-ce980bb1e5cb","resolution":{"observed_at":"2026-07-02T02:46:29.477885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-02T17:56:34.317060Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:1351b0881b8881fb79dd0fd5dd9aec4d47acc2afb1b72d9df6edde9894c7ea97","observation_id":"a7005d31-ff81-4f4e-8b79-86aed1c59557","resolution":{"observed_at":"2026-07-02T10:46:52.407400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.06740","last_updated":"2026-06-04T21:54:56Z","snapshot_observed_at":"2026-08-06T14:37:33.968008Z","submitted_at":"2026-06-04T21:54:56Z","title":"Multilingual Multi-Speaker Unit Vocoders: A Systematic Analysis of Discrete Speech Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T23:29:48.769390Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.06740"},"observation_digest":"sha256:445587c89d5bd7077fca215c0855a95daa8e7f0d70febcb9592bbd77d5cd5be4","observation_id":"096a4347-caba-4d24-beac-f6c1c3973ea4","resolution":{"observed_at":"2026-07-02T15:47:06.285476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.06743","last_updated":"2026-06-04T21:57:18Z","snapshot_observed_at":"2026-08-09T22:02:45.157982Z","submitted_at":"2026-06-04T21:57:18Z","title":"HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T23:27:29.942344Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.06743"},"observation_digest":"sha256:e049a87e0a6f6de5787a66c77fce7798a52eadc5a4085a2883a26ea0043a6971","observation_id":"df00d1c9-6a16-4eab-b16d-22244251e401","resolution":{"observed_at":"2026-07-02T15:47:06.437959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.10758","last_updated":"2026-06-09T12:10:29Z","snapshot_observed_at":"2026-08-08T00:05:46.066588Z","submitted_at":"2026-06-09T12:10:29Z","title":"Anchoring the Unknown: Open-Set Model Attribution via Proxy-Anchor Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T11:48:10.283990Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.10758"},"observation_digest":"sha256:66e9e8d16859dbbe99706addbbe26ebbfa96a792d8c58333c77bc1134d4bd6a3","observation_id":"94f4db8b-a6c4-497d-8893-3890574eabc1","resolution":{"observed_at":"2026-07-03T07:47:44.712442Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.11429","last_updated":"2026-06-09T20:27:59Z","snapshot_observed_at":"2026-08-06T11:26:39.889953Z","submitted_at":"2026-06-09T20:27:59Z","title":"Gumbel-BEARD: Automatic Layer Selection for Self-Supervised Adaptation of Whisper in Low-Resource Domains","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T11:21:16.723967Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.11429"},"observation_digest":"sha256:b5e8baed7373bc0fdfcae7d80f3d31f5e2357e8193e354556448e33883898e16","observation_id":"86ac0d2e-d37f-417e-848d-eea1f8ef4494","resolution":{"observed_at":"2026-06-28T03:11:31.188666Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.11542","last_updated":"2026-06-10T01:07:32Z","snapshot_observed_at":"2026-08-04T09:55:13.088817Z","submitted_at":"2026-06-10T01:07:32Z","title":"Pretrained self-supervised speech models can recognize unseen consonants","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T10:14:47.932613Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.11542"},"observation_digest":"sha256:4e6e3725a6911f7c521e205d26cbd77677be8d544a02caef656881a0171ab5ab","observation_id":"505cbd3d-906a-4bfd-a491-1c88ca960e0a","resolution":{"observed_at":"2026-07-03T10:07:56.072798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:ecda7ced836822b6ada3609c550751369215ba962567d0fb3081958a87c9a61d","observation_id":"46b8da44-a37f-4631-accb-50f80bbbd1b5","resolution":{"observed_at":"2026-07-03T16:08:37.520098Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.17742","last_updated":"2026-06-16T10:03:47Z","snapshot_observed_at":"2026-08-07T16:11:13.461225Z","submitted_at":"2026-06-16T10:03:47Z","title":"BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T01:18:46.958501Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.17742"},"observation_digest":"sha256:afb45f3367efa4f01e09d7cd1f531dd93e89dee390f5e0b827e02845f9a3cd7c","observation_id":"2a138061-4672-4382-ba64-ee1c02dd87ad","resolution":{"observed_at":"2026-07-03T20:28:55.750398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.18094","last_updated":"2026-06-16T15:58:36Z","snapshot_observed_at":"2026-08-06T09:45:28.037024Z","submitted_at":"2026-06-16T15:58:36Z","title":"Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T22:43:07.952982Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.18094"},"observation_digest":"sha256:4c768f6ea23806f9a4bef9d365253f204575e5121c6c241bfe511c809f41f7df","observation_id":"f2924d50-7e66-4653-8e36-8368c1e3c2bb","resolution":{"observed_at":"2026-07-03T23:19:03.188350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.20218","last_updated":"2026-06-18T13:32:57Z","snapshot_observed_at":"2026-08-07T14:10:43.984291Z","submitted_at":"2026-06-18T13:32:57Z","title":"Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T15:49:21.097255Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.20218"},"observation_digest":"sha256:50745682b454ef32b157efee5ab079606e49e5cb0b0962816282ac14d60ae430","observation_id":"84bea949-1a59-4de3-8a61-7b53ccd35fa1","resolution":{"observed_at":"2026-07-04T05:39:39.687965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.21237","last_updated":"2026-06-19T09:00:48Z","snapshot_observed_at":"2026-08-11T08:15:23.511061Z","submitted_at":"2026-06-19T09:00:48Z","title":"OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:16.717868Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.21237"},"observation_digest":"sha256:5c97fc287e9f76eefcb28da9b05bba0965435622d7dec85b3b4f2e90d32ce4bf","observation_id":"d39fe1b6-f753-4493-a467-39386c86c7af","resolution":{"observed_at":"2026-07-04T06:19:37.722796Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.25424","last_updated":"2026-06-24T05:32:20Z","snapshot_observed_at":"2026-08-06T20:58:04.719575Z","submitted_at":"2026-06-24T05:32:20Z","title":"Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-25T20:11:18.045777Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.25424"},"observation_digest":"sha256:7281392687f9f41b3c67f3959e849d6a70283faae5a72fa5b5e382e262346add","observation_id":"0a89363e-c645-41f9-aa85-98655d7b56f7","resolution":{"observed_at":"2026-07-04T20:20:07.945691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.28568","last_updated":"2026-06-26T19:48:44Z","snapshot_observed_at":"2026-08-06T23:44:25.772327Z","submitted_at":"2026-06-26T19:48:44Z","title":"KM-Speaker: Keypoint-Based Style Control for High-Quality Speech-Driven 3D Facial Animation and Dialogue Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T01:07:49.064263Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.28568"},"observation_digest":"sha256:3efa7f1f5b0c57d6f5683e4efc7109b8aeb861cb044e170ec0cca247f5de5087","observation_id":"0a31f934-31ab-432d-9ee1-1ef2a8c5f835","resolution":{"observed_at":"2026-07-01T15:45:48.558494Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":240,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:baef0ec2974f493deac77a503ebbdf4496067a86e9883210af58271d86653b03","observation_id":"53facf2d-0be8-4702-a28a-68034568f1c2","resolution":{"observed_at":"2026-07-01T11:55:42.189673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2606.31729","last_updated":"2026-06-30T14:28:41Z","snapshot_observed_at":"2026-08-07T11:38:14.977292Z","submitted_at":"2026-06-30T14:28:41Z","title":"Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T03:32:23.838961Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2606.31729"},"observation_digest":"sha256:bf3693d4ae28b5852f4123e3e83c3632f87a55aebb1129624701db7d1729e14c","observation_id":"0b7d441c-1ce7-4721-a804-9212530cdf22","resolution":{"observed_at":"2026-07-01T11:55:42.960525Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":"2312.05187","doi":"10.48550/arxiv.2312.05187","metadata_source":"pith","pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://arxiv.org/abs/2312.05187","venue":"cs.CL","work_id":"0749eb94-6dd5-4646-9f36-a0d1efc1221b","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":233,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:b368b97514cf80554fdb024d5d31a8e45bc76662953b63fb59857fdc0b5b90df","observation_id":"4f908b46-439e-4ac9-8e7e-65d3fa8bd2da","resolution":{"observed_at":"2026-07-08T00:04:22.694856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2312.05187 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":233,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:537eb4ddabf53716e43196fbcdb604692da0484eee46aa8e55151b4327370955","observation_id":"4d47e0f6-4983-4343-b674-ac7667bed826","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-07-14T12:15:06.470439Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10371","last_updated":"2026-07-11T15:48:03Z","snapshot_observed_at":"2026-08-07T10:45:20.188896Z","submitted_at":"2026-07-11T15:48:03Z","title":"GigaAM Multilingual: Foundation Model for Underrepresented Languages","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T12:15:06.470439Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.10371"},"observation_digest":"sha256:fe12e42f5f2ce061624836ba0750f497f1faa0b8ce76228b8ed07642dfcceae0","observation_id":"d9c7ef2d-ae9c-4011-a625-d203dc28a578","resolution":{"observed_at":"2026-07-14T12:15:06.470439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-01T20:47:02.397442Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.397442Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:e3869fc11cff2ec46ec5684cd65451b43cb5c32c48453cf76179859fa366bef7","observation_id":"8c533b46-5142-4199-a6da-7df8b69f18f0","resolution":{"observed_at":"2026-08-01T20:47:02.397442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-01T17:45:42.261982Z","title":"arXiv preprint arXiv:2312.05187 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-07T11:10:34.915152Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.261982Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:8c1bc41b75cc24509c427e8202b3e26f181b866446cf0d1d6e82eac738d6bb73","observation_id":"c8ff292f-e501-46d2-b0ea-5a210388216d","resolution":{"observed_at":"2026-08-01T17:45:42.261982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-01T15:52:51.239863Z","title":"Seamless: Multilingual expressive and streaming speech translation.arXiv preprint arXiv:2312.05187,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18171","last_updated":"2026-08-10T06:51:12Z","snapshot_observed_at":"2026-08-11T08:16:12.646902Z","submitted_at":"2026-07-20T17:12:28Z","title":"FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T15:52:51.239863Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.18171"},"observation_digest":"sha256:33cb8c1bfcbd7aeb4f106feace1a5c4b8e027af793366caca41d28ae39c082d4","observation_id":"be2d0bd3-ed51-44f4-9f59-792e38fcd503","resolution":{"observed_at":"2026-08-01T15:52:51.239863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-01T11:43:06.630799Z","title":"Seamless:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19810","last_updated":"2026-07-22T06:42:20Z","snapshot_observed_at":"2026-08-07T23:49:52.327639Z","submitted_at":"2026-07-22T06:42:20Z","title":"SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision","version":1},"reference_index":192,"source":"arxiv_source","source_observed_at":"2026-08-01T11:43:06.630799Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.19810"},"observation_digest":"sha256:9a2eb5dc38dc0afa49a055cbc4fd28344d1b87d3286b1460fdc749bbdf7c6435","observation_id":"b2df21b3-0f26-4327-b575-024c73baea70","resolution":{"observed_at":"2026-08-01T11:43:06.630799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-07-31T10:28:22.922154Z","title":"Seamless: Multilingual expressive and streaming speech translation.arXiv preprint arXiv:2312.05187,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.922154Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:4e34848ea4cd1d23cf65610554e0cbdadae4af0b5ebc24c8a58dd49c4444a810","observation_id":"5a0d7f71-e7bf-4804-8b48-f7515130997f","resolution":{"observed_at":"2026-07-31T10:28:22.922154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.05187/citation-record","integrity":"/paper/2312.05187/integrity","json":"/paper/2312.05187/citation-record.json","paper":"/paper/2312.05187"},"outbound":[],"paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 76 inbound Pith citation observations for arXiv:2312.05187."}