{"as_of":"2026-08-06T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd6ecb9e224fc7ae6d65ee63918076f74468708a890b14553b042dd9493d2992","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:45:44.690910Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17544/citation-record","integrity":"/paper/2607.17544/integrity","json":"/paper/2607.17544/citation-record.json","paper":"/paper/2607.17544"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:39.824389Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:39.824389Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:865aa4438659dd178abe7358d84a365157943a79d2ada4eaffef849420509881","observation_id":"c38cc5ec-eec0-41ca-a877-1559c29c5da5","resolution":{"observed_at":"2026-08-01T17:45:39.824389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:39.901049Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:39.901049Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:067abcadb28942ec623ddc899d2e8a89ee8ef7573ea18d7e6d88557b44cbee77","observation_id":"3cd7250d-e651-448e-9a14-80c93ffc8c1e","resolution":{"observed_at":"2026-08-01T17:45:39.901049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:40.017746Z","title":"The Computational Geometry Algorithms Library , subtitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.017746Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:13a4de14a7ead6a6ba8e2d8d91c3743e188d505d47f8e8a023c50493c0dee15e","observation_id":"77a6e6db-6019-4d7a-82d0-d933155667bd","resolution":{"observed_at":"2026-08-01T17:45:40.017746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:40.088279Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.088279Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:91195fd34964ee87fef3d69a89f51ea6cc4b66ede7a612b521ceb5278db097b7","observation_id":"a2f75ffd-b7ef-43bb-ae9f-9a9d3b2f6450","resolution":{"observed_at":"2026-08-01T17:45:40.088279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:40.194135Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.194135Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:f5eaf7a4ae1bd099e440432726a890aa285c53bf43e75d05c6dfa4138d634e8b","observation_id":"042391c5-a409-4ece-8c07-2ab955225c31","resolution":{"observed_at":"2026-08-01T17:45:40.194135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06037","last_updated":"2019-06-25T21:34:10Z","snapshot_observed_at":"2026-07-06T07:45:36.636186Z","submitted_at":"2019-04-12T05:15:31Z","title":"Direct speech-to-speech translation with a sequence-to-sequence model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06037","snapshot_observed_at":"2026-08-01T17:45:40.269688Z","title":"arXiv preprint arXiv:1904.06037 , year =","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.269688Z"},"links":{"cited_paper":"/paper/1904.06037","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:5e9633eae5e9fd382aef63fd9e91d50e29642c83f4866d56102aa4be3b9bc3d5","observation_id":"db54bc7a-b2ee-422d-97f9-394632452cb5","resolution":{"observed_at":"2026-08-01T17:45:40.269688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08661","last_updated":"2022-05-17T20:40:26Z","snapshot_observed_at":"2026-07-06T11:30:12.779948Z","submitted_at":"2021-07-19T07:43:49Z","title":"Translatotron 2: High-quality direct speech-to-speech translation with voice preservation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08661","snapshot_observed_at":"2026-08-01T17:45:40.334024Z","title":"arXiv preprint arXiv:2107.08661 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.334024Z"},"links":{"cited_paper":"/paper/2107.08661","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:8ac468b28a2f9d781b71909522abbceaa3f1a5d8ac35e8e6bc46f9b903619662","observation_id":"a07b94f5-756d-415e-baa1-7f377da21aee","resolution":{"observed_at":"2026-08-01T17:45:40.334024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-01T17:45:40.381348Z","title":"arXiv preprint arXiv:2308.11596 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.381348Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:ea340130eb15b2c08d94bc70c5ef1128b556d61c2517fa63cc24e8a5bd1064cc","observation_id":"ffc07853-a44d-432a-85b0-39ba25861b2e","resolution":{"observed_at":"2026-08-01T17:45:40.381348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03713","last_updated":"2022-06-26T06:14:05Z","snapshot_observed_at":"2026-08-04T22:08:51.911143Z","submitted_at":"2022-01-11T00:27:08Z","title":"CVSS Corpus and Massively Multilingual Speech-to-Speech Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03713","snapshot_observed_at":"2026-08-01T17:45:40.494682Z","title":"arXiv preprint arXiv:2201.03713 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.494682Z"},"links":{"cited_paper":"/paper/2201.03713","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:75392ffb454b6a2b7fe4d9a7693304018ae9316aba61ac86930eee4f546d317f","observation_id":"e5c35412-3c79-4807-8f09-df2d7189779a","resolution":{"observed_at":"2026-08-01T17:45:40.494682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:40.633357Z","title":"2019 , address =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.633357Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:e0ff41e1034708a3ed0bf2565fe402e96196e251cb3df10a09dd35bb7d09a81f","observation_id":"7d0f0433-6260-4797-bd22-4b6bb373d6c1","resolution":{"observed_at":"2026-08-01T17:45:40.633357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12406","last_updated":"2019-09-26T21:32:50Z","snapshot_observed_at":"2026-08-01T11:32:02.592655Z","submitted_at":"2019-09-26T21:32:50Z","title":"Monotonic Multihead Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12406","snapshot_observed_at":"2026-08-01T17:45:40.782959Z","title":"arXiv preprint arXiv:1909.12406 , year =","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.782959Z"},"links":{"cited_paper":"/paper/1909.12406","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:99f8fcc8032762d80cb4e91c50fabf7fb678761c41b7f7a79f618fa0659f1d6b","observation_id":"a1bb1d08-7bde-4dee-aa76-97fa0e5ab6a2","resolution":{"observed_at":"2026-08-01T17:45:40.782959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.16193","last_updated":"2020-07-31T17:44:41Z","snapshot_observed_at":"2026-08-03T16:18:49.647801Z","submitted_at":"2020-07-31T17:44:41Z","title":"SimulEval: An Evaluation Toolkit for Simultaneous Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.16193","snapshot_observed_at":"2026-08-01T17:45:40.937394Z","title":"arXiv preprint arXiv:2007.16193 , year =","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:40.937394Z"},"links":{"cited_paper":"/paper/2007.16193","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:dda6539272dec68d51b0608e925334e1c82c3693e6f220365d9cc6afb3924fa6","observation_id":"b0666859-77d5-4661-a047-9202d9d71d85","resolution":{"observed_at":"2026-08-01T17:45:40.937394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08250","last_updated":"2022-01-12T22:30:25Z","snapshot_observed_at":"2026-07-06T11:58:24.426799Z","submitted_at":"2021-10-15T17:59:15Z","title":"Direct Simultaneous Speech-to-Speech Translation with Variational Monotonic Multihead Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08250","snapshot_observed_at":"2026-08-01T17:45:41.069388Z","title":"arXiv preprint arXiv:2110.08250 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.069388Z"},"links":{"cited_paper":"/paper/2110.08250","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:97f3c6352df9c9e73c435490d06d18edb26269fbfda3d745354e67c53f16afff","observation_id":"dd8ed63f-6a4f-4c98-931b-5ea55a240cb7","resolution":{"observed_at":"2026-08-01T17:45:41.069388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03049","last_updated":"2024-06-05T08:24:22Z","snapshot_observed_at":"2026-08-03T15:25:01.058662Z","submitted_at":"2024-06-05T08:24:22Z","title":"StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03049","snapshot_observed_at":"2026-08-01T17:45:41.181151Z","title":"arXiv preprint arXiv:2406.03049 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.181151Z"},"links":{"cited_paper":"/paper/2406.03049","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:f5292c4d5d3a79035cffb9b102ae1b4d51df2817a55e33078a9ff344078da383","observation_id":"dea757ae-d870-432e-a98f-18b60f93f330","resolution":{"observed_at":"2026-08-01T17:45:41.181151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-01T17:45:41.291907Z","title":"arXiv preprint arXiv:2301.02111 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.291907Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:a1da831cdc7851aa9e1238a4bbcc08406cc7a2e28ac45db3eaadd0a38e2a3ff0","observation_id":"4cc0cd6e-78d7-401a-a990-9fa1d39a03e1","resolution":{"observed_at":"2026-08-01T17:45:41.291907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-01T17:45:41.413951Z","title":"arXiv preprint arXiv:2306.15687 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.413951Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:43a9a03064e95c91676513a9ac692a05846e3cc6e3b9e369e9311d901e340162","observation_id":"b386eac8-8089-4c0d-89f8-1bac72d4b507","resolution":{"observed_at":"2026-08-01T17:45:41.413951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-01T17:45:41.596599Z","title":"arXiv preprint arXiv:2407.05407 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.596599Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:36634bd9ef53ed2debc91373d13e34c50900e597b6f0cf8c8698b1b87e301600","observation_id":"1fb96152-ee9c-4591-80f0-ffe0c5a3e879","resolution":{"observed_at":"2026-08-01T17:45:41.596599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.01320","last_updated":"2020-06-09T19:24:52Z","snapshot_observed_at":"2026-07-06T08:54:49.590712Z","submitted_at":"2020-02-04T14:35:28Z","title":"CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.01320","snapshot_observed_at":"2026-08-01T17:45:41.700223Z","title":"arXiv preprint arXiv:2002.01320 , year =","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.700223Z"},"links":{"cited_paper":"/paper/2002.01320","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:6975d36a3ceabb2477b48da7bc3007ff85509f1311651b27f0a0a44db162fa0b","observation_id":"96d0fa11-81cb-47a8-814f-6a67ece68873","resolution":{"observed_at":"2026-08-01T17:45:41.700223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12446","last_updated":"2022-05-25T02:29:03Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:29:03Z","title":"FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12446","snapshot_observed_at":"2026-08-01T17:45:41.785420Z","title":"arXiv preprint arXiv:2205.12446 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.785420Z"},"links":{"cited_paper":"/paper/2205.12446","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:249a81320015827aa52358e0813f0f0f54047d503c7a1861012192b3c47833ad","observation_id":"b9f8c728-53b6-43b0-8ad9-6951928f0dd8","resolution":{"observed_at":"2026-08-01T17:45:41.785420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04508","last_updated":"2022-11-08T19:09:27Z","snapshot_observed_at":"2026-07-06T14:15:56.156097Z","submitted_at":"2022-11-08T19:09:27Z","title":"SpeechMatrix: A Large-Scale Mined Corpus of Multilingual Speech-to-Speech Translations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04508","snapshot_observed_at":"2026-08-01T17:45:41.852061Z","title":"arXiv preprint arXiv:2211.04508 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.852061Z"},"links":{"cited_paper":"/paper/2211.04508","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:81346e091437058f58490519dba2e6884ed01b9e65c25d5140915f2b4bcd1d70","observation_id":"7546165c-fd66-4cba-9f7a-5111dfbc527c","resolution":{"observed_at":"2026-08-01T17:45:41.852061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30792","last_updated":"2026-05-29T03:31:04Z","snapshot_observed_at":"2026-07-06T23:40:03.151978Z","submitted_at":"2026-05-29T03:31:04Z","title":"OpenSTBench: Beyond Semantic Evaluation for Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30792","snapshot_observed_at":"2026-08-01T17:45:41.910730Z","title":"arXiv preprint arXiv:2605.30792 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.910730Z"},"links":{"cited_paper":"/paper/2605.30792","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:326fed421ffce36163671518f321d4b127e1ffa93741cfa59975037313885dbc","observation_id":"560dd04b-f225-4bce-ac0c-d0759eb0cede","resolution":{"observed_at":"2026-08-01T17:45:41.910730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","snapshot_observed_at":"2026-08-01T09:02:55.295903Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05604","snapshot_observed_at":"2026-08-01T17:45:41.971525Z","title":"arXiv preprint arXiv:2107.05604 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.971525Z"},"links":{"cited_paper":"/paper/2107.05604","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:086dd4efa6f3eed688dfd312e2a3c5a5e3f5f43bed496df69dc02fa3c988b4ae","observation_id":"c958fde4-9c36-466c-8ee0-bfdbeef854d0","resolution":{"observed_at":"2026-08-01T17:45:41.971525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08352","last_updated":"2022-05-04T18:16:38Z","snapshot_observed_at":"2026-08-06T07:54:31.859843Z","submitted_at":"2021-12-15T18:56:35Z","title":"Textless Speech-to-Speech Translation on Real Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08352","snapshot_observed_at":"2026-08-01T17:45:42.038926Z","title":"arXiv preprint arXiv:2112.08352 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.038926Z"},"links":{"cited_paper":"/paper/2112.08352","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:73bab56eb980bac617dac95ac09ad32c93e1c87c0b8dbf075fe5a7cda72d30f6","observation_id":"7622d0a7-117c-4d7d-90d0-ec19b22d9fe7","resolution":{"observed_at":"2026-08-01T17:45:42.038926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12523","last_updated":"2023-03-02T09:17:01Z","snapshot_observed_at":"2026-07-06T13:13:40.650733Z","submitted_at":"2022-05-25T06:34:14Z","title":"TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12523","snapshot_observed_at":"2026-08-01T17:45:42.099704Z","title":"arXiv preprint arXiv:2205.12523 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.099704Z"},"links":{"cited_paper":"/paper/2205.12523","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:3b193e06e847bdddb5e3ff3f166a876ee4df6b5df53a387e3531e1eefdf52dbb","observation_id":"86c4c0af-dadc-4970-b080-7d30655fd657","resolution":{"observed_at":"2026-08-01T17:45:42.099704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07403","last_updated":"2023-10-11T11:39:36Z","snapshot_observed_at":"2026-08-04T12:26:23.277346Z","submitted_at":"2023-10-11T11:39:36Z","title":"DASpeech: Directed Acyclic Transformer for Fast and High-quality Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07403","snapshot_observed_at":"2026-08-01T17:45:42.195262Z","title":"arXiv preprint arXiv:2310.07403 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.195262Z"},"links":{"cited_paper":"/paper/2310.07403","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:d4cb334596a445780adc2c22cf62af199467643da1493140cbefde7d7adddc53","observation_id":"1b056440-f798-4b61-b9f8-fdd9ac8a9fe5","resolution":{"observed_at":"2026-08-01T17:45:42.195262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-07-06T16:58:55.520897Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-01T17:45:42.261982Z","title":"arXiv preprint arXiv:2312.05187 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.261982Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:ed392c1f29f4b2fdedd68c177e2ed2398dee9c9e49a61718f2941c2ad0bedd6b","observation_id":"c8ff292f-e501-46d2-b0ea-5a210388216d","resolution":{"observed_at":"2026-08-01T17:45:42.261982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17527","last_updated":"2025-07-27T05:17:25Z","snapshot_observed_at":"2026-07-06T22:01:40.281520Z","submitted_at":"2025-07-23T14:07:41Z","title":"Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17527","snapshot_observed_at":"2026-08-01T17:45:42.428939Z","title":"arXiv preprint arXiv:2507.17527 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.428939Z"},"links":{"cited_paper":"/paper/2507.17527","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:c8734de6c72729bff9a61ed5a4380a7891bbe25dc49956b85479e62503c61d66","observation_id":"d9d0909c-30a2-4abc-814c-03659acb8eb1","resolution":{"observed_at":"2026-08-01T17:45:42.428939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:42.581106Z","title":"arXiv preprint arXiv:2509.21144 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.581106Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:a2705bc5fadbd6e69c1ea44fa86d4e0bf110b341971fc94427e9afc537c8ef1a","observation_id":"98cc7877-6e76-4aa2-a1c3-f8e23416a681","resolution":{"observed_at":"2026-08-01T17:45:42.581106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:42.713159Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.713159Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:5e82b9fb72d1f3b6c41db7c4f11c00d6302d64b96dd15949836878e137bec7bc","observation_id":"be8a68cc-b057-442b-b753-b48cef4e7bcf","resolution":{"observed_at":"2026-08-01T17:45:42.713159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-01T17:45:42.780361Z","title":"arXiv preprint arXiv:2207.04672 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.780361Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:9b5a514d9ef8e282ea67e04ea6127af12c190de9d533cd8fb8b218bc083646a3","observation_id":"edf121e0-c812-4c21-8673-5f14a155645f","resolution":{"observed_at":"2026-08-01T17:45:42.780361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing , month = nov, year =","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"056e4178-c53f-47fb-969f-fe6e5eab85fc","year":2021},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.844907Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:3e223184f9e2b6daa40babd1c5c272d6f85452ce6b046f13c74110feaf68ab18","observation_id":"f6fe9e51-07d0-4cf5-afb6-9072a68243ea","resolution":{"observed_at":"2026-08-01T17:48:27.835544Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:42.924985Z","title":"Interspeech 2020 , publisher =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:42.924985Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:8eb70dd857d8f75e481ce8acf40f8ff0502ccba5a3cb5a21bf41c77d5c2cf5c8","observation_id":"30d4ed4c-9d79-49ba-a8ee-619033dbf171","resolution":{"observed_at":"2026-08-01T17:45:42.924985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.019258Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , month = jul, year =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.019258Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:f1741caad2ad8f21962a208f6df4b59477d5f461fdefc60af71022f90702d052","observation_id":"000d6fa3-3cc4-4c2f-9cbe-7aab3dd12e3a","resolution":{"observed_at":"2026-08-01T17:45:43.019258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.079462Z","title":"Interspeech 2023 , year =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.079462Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:bae5c7f8a3cde49e6cba9400933a7a8a96ef23ea4d1e7cc82d232abed5e5ef05","observation_id":"8cae1b79-5df3-4ba6-937c-827dea98f700","resolution":{"observed_at":"2026-08-01T17:45:43.079462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1238","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , month = nov, year =","venue":null,"work_id":"21c64e8f-231c-4469-a4cb-b6648ba00cf6","year":2024},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.147754Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:c9cce91573129aba70221f87b888a22a44e1f086df85e73932d50c2db23eb7bc","observation_id":"0a8f787e-2103-44d2-9565-a5a077df4f82","resolution":{"observed_at":"2026-08-01T17:48:27.776708Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.219163Z","title":"Discourse Processes , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.219163Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:2cb7eb9b21b5266733a00435a4ef30d50500ffe9723e01021b1297534abc4658","observation_id":"8f4e59cc-1251-4da5-9fef-9b3c03ec1137","resolution":{"observed_at":"2026-08-01T17:45:43.219163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.304740Z","title":"Interspeech 2021 , publisher =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.304740Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:7a4f3723dc4edf3e7aebc12170e07a6d596305b07d8466b25873b9210f0aeb63","observation_id":"dc9c888d-3139-430a-9bcd-f6a54861603f","resolution":{"observed_at":"2026-08-01T17:45:43.304740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.363590Z","title":"F5- TTS : A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.363590Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:7aec843827137cecd138b1578e0d7fb44d48a004f92d0447d7ac8f493c845646","observation_id":"050cfcbf-314c-4589-8a0b-951009946267","resolution":{"observed_at":"2026-08-01T17:45:43.363590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.449143Z","title":"IEEE Access , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.449143Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:98efa2d55a8a1c7618ae00d97b653d6b2b8afb5edec2fc6ef4f8f87d1283dde0","observation_id":"e41a022a-f8a3-4496-bec8-9dd4ab78a0f4","resolution":{"observed_at":"2026-08-01T17:45:43.449143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.506082Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.506082Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:b1235d34233b3273e606e7a4eb5d44b192fce3f6e41d091c612b2229d37e6a6c","observation_id":"675d1dfe-27ca-4753-a7b0-77d9bad18b47","resolution":{"observed_at":"2026-08-01T17:45:43.506082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2020-2337","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spot the Conversation: Speaker Diarisation in the Wild , url=","venue":null,"work_id":"5ebf7390-ae51-4233-9c99-c1035cfb2623","year":2020},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.567635Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:33ea221b609461b6d497ad19fe1aaaad69791e7deb581cbaa8a6a55fa0523dde","observation_id":"0c7699ab-5618-4406-975b-d669913c7b44","resolution":{"observed_at":"2026-08-01T17:48:27.709605Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.669848Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.669848Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:16b04c14e2418be3ab7fc629db71c5ca248a681593c5b27e2d30769c91119bc1","observation_id":"20cb98ae-5cbe-4c9e-b70f-0bfec2542413","resolution":{"observed_at":"2026-08-01T17:45:43.669848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:43.733953Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.733953Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:34ad9e5f949d5a8ff13501f0dc2762b8a655d6d88202e7af576fc46dcfe5b5ac","observation_id":"f9a6a665-1975-46ee-a2b8-98d4998b808d","resolution":{"observed_at":"2026-08-01T17:45:43.733953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-01T17:45:43.822357Z","title":"arXiv preprint arXiv:2303.00332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.822357Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:3dfdc66f65d55a9c7b73a33766c95b76193a23d33234d3b9d9c51aaa4b1a33da","observation_id":"9842536f-f687-4b94-bc37-531637d17157","resolution":{"observed_at":"2026-08-01T17:45:43.822357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-01T17:45:43.924287Z","title":"arXiv preprint arXiv:2601.21337 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.924287Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:ee0a99d22406ddb1f79b828ff30377f4c821a1537f5b2c63408f6effb2135967","observation_id":"83671b0f-f26a-46b9-8bfa-35b815a9f7bb","resolution":{"observed_at":"2026-08-01T17:45:43.924287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-01T17:45:44.024035Z","title":"arXiv preprint arXiv:2206.08317 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.024035Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:56519bedfb71439e3ca61d2b0dbd114815943c2fa67320721669394f9abb8e4d","observation_id":"85c1e9cc-32e7-4d3b-9141-c4418fea87ea","resolution":{"observed_at":"2026-08-01T17:45:44.024035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-01T17:45:44.117972Z","title":"arXiv preprint arXiv:2407.04051 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.117972Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:7df907323f0765e936c188e8308eb56fcc8d6555aec5f85367b4d6a061ee9e39","observation_id":"6b653848-56e3-4172-847a-1efdb72eac23","resolution":{"observed_at":"2026-08-01T17:45:44.117972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:44.213669Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.213669Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:2962522c7c298cf4d127a72aefb4dfdac4503623a6b68a144241772bb75148a7","observation_id":"21365732-441a-4d65-8c7f-d492e0232d46","resolution":{"observed_at":"2026-08-01T17:45:44.213669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:44.301245Z","title":"arXiv preprint arXiv:2512.24092 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.301245Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:86f7fd887f9d4ba6cc7996bb0e7fd54fc650dbb6cb860dac1e9e7aacf7bd945e","observation_id":"7bae4588-cf56-4a0f-83fc-c2a1eca95688","resolution":{"observed_at":"2026-08-01T17:45:44.301245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-05T17:33:03.736753Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-01T17:45:44.391170Z","title":"arXiv preprint arXiv:2502.05512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.391170Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:04c399896d0bc04591512e52e16e3f94ae67914099376d21350d25dbb00012d0","observation_id":"148d8915-cd7c-42ea-b5af-27826fc4e2d2","resolution":{"observed_at":"2026-08-01T17:45:44.391170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-07-06T23:18:12.631820Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05611","snapshot_observed_at":"2026-08-01T17:45:44.429618Z","title":"arXiv preprint arXiv:2605.05611 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.429618Z"},"links":{"cited_paper":"/paper/2605.05611","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:7e03a1d73dff52f9260ae4ba5de75b9ede5cb119f38db171f440b9f7c9d60c6a","observation_id":"4532b4ca-d15a-4389-9f98-0c88e87a9c2e","resolution":{"observed_at":"2026-08-01T17:45:44.429618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:44.539426Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.539426Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:98b5cda525f0b6d7a3ab4d8fc5f4cf0580c9b811f6e2dfe43d65d9055dc9cd32","observation_id":"6782b11c-c8de-4dca-a394-d406d39ae6c9","resolution":{"observed_at":"2026-08-01T17:45:44.539426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:45:44.690910Z","title":"International conference on speech and computer , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.690910Z"},"links":{"citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:8cd7482ed1476daa6617ef499943b38c030d715f9fbb4eb3d5af69513e90603a","observation_id":"ae2aae5f-c345-4ad4-b002-651e37db6931","resolution":{"observed_at":"2026-08-01T17:45:44.690910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-05T16:33:20.345300Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.17544."}