{"as_of":"2026-08-12T18:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d06b6a19a477206a8b08e2f1320bc4d33636f0aa9594c0599c8bf2e1a1afc459","coverage":[{"denominator":123,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T13:14:15.684960Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.00890/citation-record","integrity":"/paper/2607.00890/integrity","json":"/paper/2607.00890/citation-record.json","paper":"/paper/2607.00890"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.971843Z","title":"multilingual","venue":null,"work_id":"b49909ff-1931-49f3-afa7-7a772292b5e0","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:03b9a00566c312fb6c4bd7968c136985823e2744fb01c735a8e7c672fb0688c4","observation_id":"ce467f72-2fc1-4e7b-9325-f16ef738084e","resolution":{"observed_at":"2026-07-06T01:21:43.973136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.975128Z","title":"Translation studies in Scandinavia , volume=","venue":null,"work_id":"37122cb3-c2a4-4da4-ae3b-e34ff4cc2191","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:9b35b9ec527dc9ad8ab95dd3563098267461538b5a984f3c19777000736f1839","observation_id":"c64eb1bd-dee6-494a-b2c1-29fbde6c8191","resolution":{"observed_at":"2026-07-06T01:21:43.976328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.985953Z","title":"CoRR , volume =","venue":null,"work_id":"892e391b-28c6-4206-9f30-03d640f80099","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:67a7718accb84279359b35d5b59ab524665f4f6ae13a9198e96e98df738ca3a2","observation_id":"d66af31f-7981-4a7f-b304-24cc1680d9f6","resolution":{"observed_at":"2026-07-06T01:21:43.987017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.961062Z","title":"and Pombal, Jos","venue":null,"work_id":"688d9fa8-c7bc-4618-833b-97c3c0eea01d","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:ec0affb45ac65735fb96bc1c4cf6c4e1ba0b8013bf14fe57b49cfda38a72507a","observation_id":"618586f0-1f59-4c26-84e7-c1980f5861f2","resolution":{"observed_at":"2026-07-06T01:21:43.962240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.928401Z","title":"First Conference on Language Modeling , year =","venue":null,"work_id":"be9ae0d7-de07-4311-85ab-03190d0fc77d","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:2dd8c9fae3162f341daf3b994ac4559ba7e9af3c55804dffe755f92ad7413d0f","observation_id":"e98317c6-ea37-465b-a3d4-e5def37e38fd","resolution":{"observed_at":"2026-07-06T01:21:43.929673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.028562Z","title":"2025 , doi =","venue":null,"work_id":"dccfc758-3c2e-42be-a30b-abe7671ad0a5","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:25b41366074592deeffe4d32cf45d84c4a0c168adc099f0acb532e22e41d0107","observation_id":"ba725acf-870a-4f27-ad9d-7bef1b656c05","resolution":{"observed_at":"2026-07-06T01:21:44.029606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.022180Z","title":"2025 , doi =","venue":null,"work_id":"92c8c4be-ea98-4c45-8541-e6a224ecae84","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:34c53e8fde0eb64f5488f4d6d1a8e7693a4870dda1221eb0963100445dd50584","observation_id":"13af0a35-fa39-4331-a4ab-77c0f39b6add","resolution":{"observed_at":"2026-07-06T01:21:44.023194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.002175Z","title":"LightEval: A lightweight framework for LLM evaluation , year =","venue":null,"work_id":"c7cf26fe-4cac-4e82-b5c7-6ca0b942706b","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:6260ababf3d9edf00996b6d98abdf924c5129057f2075fa7ed02c686891ca4a3","observation_id":"bc01218f-4a33-4378-9f13-6394a768b49f","resolution":{"observed_at":"2026-07-06T01:21:44.003356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.12608602","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:45.648157Z","title":"doi:10.5281/zenodo.12608602 , url =","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"2c57f331-c45e-4b28-9887-1931db7da39f","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:0699af83bebe75df310a45afd1a6027345583d431ff89433983ccd0ce9f0694a","observation_id":"cb925d21-5e93-4920-bff0-e9a32343301c","resolution":{"observed_at":"2026-07-02T13:16:57.925228Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.181","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"N or E val: A N orwegian Language Understanding and Generation Evaluation Benchmark","venue":null,"work_id":"c5232f7f-f4d7-4982-a352-64a2e279a1b5","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:6f1164715e746bb33a7d403e0cdf284f3a49ec4824c7594b5e67fcff5ec0a379","observation_id":"7a4a52ed-33b8-4844-84a8-65a700083fbd","resolution":{"observed_at":"2026-07-02T13:16:57.920289Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.046551Z","title":"The Fourteenth International Conference on Learning Representations , year =","venue":null,"work_id":"d8c90a3f-be3f-4a07-977b-b4d8dea7c57f","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:81d7f2840c812616b88a5b5d32007f91f41804d80745785b18f218e4eabc2ad7","observation_id":"89d70643-a248-4a2a-80b1-2fac89af2a6d","resolution":{"observed_at":"2026-07-06T01:21:44.047686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-024-07566-y","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anderson and Yarin Gal , title =","venue":"Nature","work_id":"a5f0c6ba-3309-44e3-8e37-842dafbd8e4c","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:5c3b3ff8f10b0cafecb1b3da64b7107a869e242e098259b68cddb0b5ccf22626","observation_id":"1d85b444-93c2-4bdf-901e-c2b88dd12412","resolution":{"observed_at":"2026-07-02T13:16:57.918270Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-07-11T03:18:53.715838+00:00","source":"paper_reference_links","state":"open"},"event_date":"2025-03-21","event_type":"correction","notice_doi":"10.1038/s41586-025-08905-3","provenance":{"observed_at":"2026-07-11T02:58:09.060211+00:00","source":"crossref","source_record_id":"10.1038/s41586-025-08905-3->10.1038/s41586-024-07566-y:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.wmt-1.139","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Tatoeba Translation Challenge -- Realistic Data Sets for Low Resource and Multilingual MT","venue":null,"work_id":"68488ac9-ddf7-416a-b147-1994d5831160","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:e8228bac7b88648aceb41a15284fb60464a8c9aff44e32bb2754573e1db9869a","observation_id":"d9aa513b-1e11-49ed-b5b2-370045a82752","resolution":{"observed_at":"2026-07-02T13:16:57.913548Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.978597Z","title":"Recent advances in natural language processing , volume=","venue":null,"work_id":"47740fef-90e0-455e-be72-181530875c9a","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:a63e6df6b32cd9fe4bc020f2a43fcc20e5eb2a5696ba024da9dc1029c52a2bff","observation_id":"a26bc0ed-9401-489c-9cc5-323c8aafc223","resolution":{"observed_at":"2026-07-06T01:21:43.979825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.949911Z","title":"author=","venue":null,"work_id":"ba930f73-6b1e-4fa4-bf60-70de62cc1202","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:d2176e1b20564d79aee1e54708adec0fdc6a5ff3d818f5740c05d715c6fa3566","observation_id":"e660fde9-379f-416e-8f90-073c7146cf4e","resolution":{"observed_at":"2026-07-06T01:21:43.951297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00065","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Krikun, Maxim and Wu, Yonghui and Chen, Zhifeng and Thorat, Nikhil and Vi \\'e gas, Fernanda and Wattenberg, Martin and Corrado, Greg and Hughes, Macduff and Dean, Jeffrey","venue":"Transactions of the Association for Computational Linguistics","work_id":"d64eee05-3639-48ed-93eb-f4a87244c68c","year":2017},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:bda6981e8c81e1163438945ba66caa6390ba25714b4a3b4d4ad88e2a109767cb","observation_id":"c45fb188-8f9c-452c-8041-d2467c37febd","resolution":{"observed_at":"2026-07-02T13:16:57.872132Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:36.858624+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:36.858624+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p18-4020","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"b0528a8c-3309-4187-aade-25bc3bf8daf8","year":2018},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:2d226b664c09049fec8f4aac57c83307a1e5a68b061e30116ef9a0e399ac8f2f","observation_id":"42883c99-4879-4950-b497-dee0d7784b58","resolution":{"observed_at":"2026-07-02T13:16:57.918763Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:36.256351+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:36.256351+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.123","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron- CC : Transforming C ommon C rawl into a refined long-horizon pretraining dataset","venue":null,"work_id":"d8a8e4e6-c0ee-45b5-9ab7-0e3c1667df2f","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:048a0ee5f423e704bb7bdc05119df5ef963c132b05a4d4182295c89901f6f435","observation_id":"d1f766cc-9a63-4a64-a6f0-469fb731dff5","resolution":{"observed_at":"2026-07-02T13:16:57.935112Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.044693Z","title":"CoRR , volume =","venue":null,"work_id":"b6b7979b-b7ea-4b3d-8c5c-599ea4401b66","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:3963fd07babb15f57b018fb5e709a26072c570413d75bc87be6a39bc0ddce988","observation_id":"3b9b2650-ba2e-4b69-af9f-642c2dcd68df","resolution":{"observed_at":"2026-07-06T01:21:44.045759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.043052Z","title":"An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (","venue":null,"work_id":"427156f4-583b-4d0d-b530-63d1858226d7","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:23315785ffcd36fb12ef9f4a9f12b7925476144f88fd03e0d59c5c127cbdd77b","observation_id":"5d952044-ac6b-4d5a-a000-434721368418","resolution":{"observed_at":"2026-07-06T01:21:44.044175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.041535Z","title":"CoRR , volume=","venue":null,"work_id":"70386180-21f8-43a3-a2d4-a6314a157d0b","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:1186f6da542a7ed4f370a8ab235f3e34df64d894447823711cd4a0228bf22eb6","observation_id":"587e8594-9344-4749-bddf-6209fa128292","resolution":{"observed_at":"2026-07-06T01:21:44.042570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.975401Z","title":null,"venue":null,"work_id":"de59ba5e-ff37-4fa0-bbb8-da82a4dc9500","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:0b4c9b3c2c46db8eef62f125565de69a1b421d0f0bd9770b9ba05ec04b15191d","observation_id":"466dffdb-5b68-46c6-b7da-9cacbbac86a4","resolution":{"observed_at":"2026-07-06T01:21:43.976670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.005787Z","title":"2019 , doi =","venue":null,"work_id":"d9fe40b2-2ded-49ee-98f3-3c2391fbdd92","year":2019},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:1ba1153f893a2c681367db0277a23d81e4ce1705a2cbcb76a2ba94833a1494ae","observation_id":"c8907ded-97f3-47c0-92c5-1b71c13813ff","resolution":{"observed_at":"2026-07-06T01:21:44.007297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.993988Z","title":"Proceedings of the Thirteenth Language Resources and Evaluation Conference , pages =","venue":null,"work_id":"8b8740de-2a7c-4799-9dff-cba4c126a1eb","year":2022},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:21786e51e7842ecc897364d1b235061584222593e87424fb43ce952712b55e23","observation_id":"d7e5b41d-0f3c-47c9-996d-26b464458f8e","resolution":{"observed_at":"2026-07-06T01:21:43.995323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.618","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Translation Artifacts in Cross-lingual Transfer Learning , booktitle =","venue":null,"work_id":"115f5a62-a58f-4a61-9c96-023660b36f93","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:346642999025d647dc44a198d888fd675b967c829858cc50681273c8559350ff","observation_id":"be6d11d7-e37d-414a-b6a9-e5e150a0dae0","resolution":{"observed_at":"2026-07-02T13:16:57.883233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.44","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language Variants , url =","venue":null,"work_id":"6e199096-25f3-40fa-a0ae-1205fd125e34","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:f7526dbc49c06788b5ecc35079e03d703e3645371499614c113f78e31c9966bb","observation_id":"b863bac5-8559-46d2-be25-3063f8dd5a6c","resolution":{"observed_at":"2026-07-02T13:16:57.881344Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:06.177806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:06.177806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.978930Z","title":"2024 , note =","venue":null,"work_id":"3f41366b-7688-49ca-83af-b6c83c92d873","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:a7927043f0b21a86ed65372b3b8308dae2d7385e5d4d01fda68eec91920c9777","observation_id":"1e7b6a6a-d930-4d68-bbd2-03118d4bb1dd","resolution":{"observed_at":"2026-07-06T01:21:43.980009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.iwslt-1.34","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Human is Machine Translationese? Comparing Human and Machine Translations of Text and Speech","venue":null,"work_id":"57708ebf-8486-4dc8-8178-9341b2bff6ca","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:46d73eda04d534bad5f048f85d1d39e4bf5410bfff45b3491cacd08383d4a86b","observation_id":"ca0d233e-22ff-4948-8784-623dd026fe0c","resolution":{"observed_at":"2026-07-02T13:16:57.929055Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.arabicnlp-1.7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the Second Arabic Natural Language Processing Conference , month = aug, year =","venue":null,"work_id":"e8fed3b4-c062-4691-b9d6-b72a9f67e08e","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:96332846fb6fc62de8d97103aff5846ee152acdec280c285d4ac76a616c0b8e0","observation_id":"08b143e4-13f8-41fc-b2de-b5b260e53ece","resolution":{"observed_at":"2026-07-02T13:16:57.900586Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:36:19.469685Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"418aefd5-8dcf-4ec7-8de4-5e620c2323bd","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:40755758087bc0768e74a996ba49bccc6a6c8d36a9db1daa94e2c458dee6e243","observation_id":"fd911464-15af-4de5-a408-00004db0eb41","resolution":{"observed_at":"2026-07-06T01:21:43.998209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.236","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chang, Catherine Arnett, Zhuowen Tu, and Benjamin K","venue":null,"work_id":"32abc970-c936-46e9-986c-2cdf5072821a","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:dc0f8ee7c464e81c4b37aba6cd3f7e5ac51684de89f5250ca60b3ec753dc38c1","observation_id":"bc862cd4-3ea4-47fe-aa45-c9e332c695d1","resolution":{"observed_at":"2026-07-02T13:16:57.933100Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-18T11:21:15.623369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T11:21:15.623369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.952066Z","title":"CoRR , volume =","venue":null,"work_id":"e01fd0ed-68fa-4311-8acb-b5c13be2967f","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:b03cbd4cf29e6f7e1648931c29e07727186ff77981c683a172762638237b6d77","observation_id":"34a6b193-f20b-4ecd-9d1d-09aa55ad3a0b","resolution":{"observed_at":"2026-07-06T01:21:43.953141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.957215Z","title":"and Choi, Eunsol and Collins, Michael and Garrette, Dan and Kwiatkowski, Tom and Nikolaev, Vitaly and Palomaki, Jennimaria , journal =","venue":null,"work_id":"f425d8e5-5cc5-4fe1-96ef-e8c6e7cb68a3","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:ca8c46e1edcd45039a9e5e240e91dc21adc63c51ab36a3ad726a5f06da7b054f","observation_id":"b9aee5fb-d5ef-4508-94cc-2eb41916109e","resolution":{"observed_at":"2026-07-06T01:21:43.958371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.010466Z","title":"2023 , doi =","venue":null,"work_id":"bf9787ac-e5bc-468d-8fd1-034a750b56e6","year":2023},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:e0f25e1410acff24b981e6a02055642d326a0ac99b0e5f07082ff868cb5c3154","observation_id":"cbf15e51-93ee-4328-a1fc-83f15b3d48b0","resolution":{"observed_at":"2026-07-06T01:21:44.011558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1269","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.18653/v1/D18-1269 , editor =","venue":null,"work_id":"658052cb-50c4-4229-8815-b95dcb20c670","year":2018},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:20826b02a0ef7b6d2da2f1f33b4811bd810d4ae8dd29efbd338fb86b500fc5e7","observation_id":"f2b68b4a-20a4-4fd1-ac2a-7b26494e85f6","resolution":{"observed_at":"2026-07-02T13:16:57.907081Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:10.563083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:10.563083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.747","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:57:20.734573Z","title":"Unsupervised Cross-lingual Representation Learning at Scale , booktitle =","venue":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics","work_id":"bad774d3-20f4-421f-ba75-d1ef99f02a26","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:db062ab51e7b50befbc9a2f6fb1585b720f905cf6c91bffe494e1fd9614d0a8d","observation_id":"d74aed98-330d-435a-ae36-7be59e53e850","resolution":{"observed_at":"2026-07-02T13:16:57.863351Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-11T01:08:26.395667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-11T01:08:26.395667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.982311Z","title":"2024 , eprint =","venue":null,"work_id":"11e3e059-c490-4d06-b436-f768737af851","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:fb38a5e2b1643ccba6ad47c2c11de4fafa91a71328c4877e146c17eb7095ee47","observation_id":"084d63b7-f59f-4aa6-88e3-1df7b645e44c","resolution":{"observed_at":"2026-07-06T01:21:43.983528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.980513Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , pages =","venue":null,"work_id":"de954166-39c5-4024-b563-b484078ade95","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:7bb8350802ec4ee81a6c13c537f031a7595b20fa9571f0e15390bb1fb1494bd3","observation_id":"d266896a-2f5a-4a69-be10-bc70ad239d5a","resolution":{"observed_at":"2026-07-06T01:21:43.981804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.1408","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Christodoulopoulos, C., Chakraborty, T., Rose, C., Peng, V","venue":null,"work_id":"6c22ee27-df6c-4771-96d7-7e0f651733f1","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:0b84b4c3ef8efd5b3a5b485eed84d837599ddfc08a412898147dea09614a6ced","observation_id":"eb4b5768-fbb7-4040-b00b-0b6b4aaff7cc","resolution":{"observed_at":"2026-07-02T13:16:57.924138Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:49:04.531699+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:49:04.531699+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.929061Z","title":"Proceedings of the 41st International Conference on Machine Learning , year =","venue":null,"work_id":"c907f403-a836-46f2-9579-c8b0de2cd510","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:9a94152efa1a0ddfc937c74c16429981fe7bdcfcce13e3b2b2b61dae950548d9","observation_id":"9d731625-a857-44df-ab4f-415e16b9c0e6","resolution":{"observed_at":"2026-07-06T01:21:43.930402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.334","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages =","venue":null,"work_id":"24cbbfc7-b4b1-4be6-8deb-50b816fccea8","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:42c32118d66bc6263fddc7e843cee6efca9f49721a1090c06d882aed38b82dcc","observation_id":"5816e97b-0ef5-4691-91b2-0f31fda50f21","resolution":{"observed_at":"2026-07-02T13:16:57.927165Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.023709Z","title":"Length-Controlled","venue":null,"work_id":"8417fabd-edc1-421d-b481-024945ad9039","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:bf8e81725387a9c4280ca76f929697eeaf38cc5c23e6a20e45c9d35c46c6ff80","observation_id":"3dc000cb-0731-468a-b2a9-ce26400b54f1","resolution":{"observed_at":"2026-07-06T01:21:44.024785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1045","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding Back-Translation at Scale","venue":null,"work_id":"b479bc45-a80e-4ac6-b1f2-fb6fd55129f7","year":2018},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:ee303ea93b698b66518cd22af1687af5d960e33ee4c9c9fec622c690f39efadd","observation_id":"20b7d694-c174-4504-aac8-847d2f01a9ad","resolution":{"observed_at":"2026-07-02T13:16:57.904958Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:49:04.289387+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:49:04.289387+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.927411Z","title":"CoRR , volume =","venue":null,"work_id":"e9fcd282-80e5-4bce-9d8e-6bf306c39a15","year":2019},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:590b7306b9cc06d3ed55380a0b72b1b3c288ef7301c1339fe28dd656fb1da888","observation_id":"471298c6-ae07-4594-938c-9b8cf13f0cb6","resolution":{"observed_at":"2026-07-06T01:21:43.928534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.031564Z","title":"2024 , url =","venue":null,"work_id":"c4b83d8b-f149-4dd5-b8c1-a20a589da09f","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:c8e7a7b939866647d5954736119825c9787afbe09ca70565d133fd00354c4c16","observation_id":"6b8583e5-425d-4e84-b31a-23c1d0b6a791","resolution":{"observed_at":"2026-07-06T01:21:44.032622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.944627Z","title":null,"venue":null,"work_id":"2ba610f7-4503-455e-9f8e-02f5a3fce735","year":2021},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:3fd277b082736e377f9592330a4319a2ea132d13e261206f4f93678bd761ad4d","observation_id":"6cdb9306-8e6d-4c74-91a6-3cc6d8c74bf2","resolution":{"observed_at":"2026-07-06T01:21:43.945806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2020 , address =","venue":null,"work_id":"b1f44320-f9d0-48fd-b1e7-45694a2b690e","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:5f733e97adf05dfb02adf688ec884ce6876a2d8962c35ada6cdfac93b565f59b","observation_id":"974464aa-b096-41ca-835b-93113e8356f1","resolution":{"observed_at":"2026-07-02T13:16:57.895093Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.035108Z","title":null,"venue":null,"work_id":"414fabe8-bd76-466f-90e6-834186d4cb13","year":2021},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:4456cee65092397d3880b2646bb42092f847a9626de76ca0bc469bb6042bf750","observation_id":"70dd5028-4107-469e-ae74-43cd0f79dac1","resolution":{"observed_at":"2026-07-06T01:21:44.036171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.036668Z","title":"First Conference on Language Modeling , year =","venue":null,"work_id":"ef105809-027d-4c6b-878a-32276bc201b0","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:658ef46c2ffa2be1f6eff28783a1afc8b8845e96ede28a10f2bd483176416489","observation_id":"8273e6a7-cbcb-4a35-90d5-44ae30a647f4","resolution":{"observed_at":"2026-07-06T01:21:44.037875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.031939Z","title":"Proceedings of the Fourth Conference on Machine Translation , year =","venue":null,"work_id":"e2c09895-3d06-49f2-8654-4c57b66a8fbe","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:7966e3707628c1df2b1ad33f2fdb152a06772f60c3c91c087b3bccbbc9902400","observation_id":"c05547a3-42ca-43a6-ac31-4466d2248e4d","resolution":{"observed_at":"2026-07-06T01:21:44.033084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) , pages =","venue":null,"work_id":"c14d4698-1767-4e6a-808e-ba6f8af3e128","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:d478d5796fdd7c0fec7d845c454eedf8aae3f36d1da46ed49b1a58fd4e9337d0","observation_id":"c47eaf48-44ee-4f27-8019-2798a7b371a4","resolution":{"observed_at":"2026-07-02T13:16:57.893117Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.038379Z","title":"A Survey on","venue":null,"work_id":"6344260e-913c-461e-aa7a-534359c41971","year":2026},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:d6fcae696b7a6e4c476bb3fcb329a7f46f348051054d1c1a4acfd5f4f04db07e","observation_id":"361669e4-0d24-4389-88d9-5185ef141853","resolution":{"observed_at":"2026-07-06T01:21:44.039426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.039913Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"67c88f25-7c97-4f50-9090-27d45f7c57ca","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:0b6df26b5636e2828c4ba2f5e5493267e8c2e12e465a244d12d4476755d01217","observation_id":"ee48bd6e-f246-4096-bd58-471029ac2309","resolution":{"observed_at":"2026-07-06T01:21:44.041051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.482","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Challenges and Strategies in Cross-Cultural NLP","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"f70e3206-e7dd-48f4-b741-ac9025de94c9","year":2022},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:0c9ef1213663f7ea141fdb5f8e718671a1ba87760e2797875dfa437f18e6d308","observation_id":"5afd9055-694b-44ae-900d-f8e54c3ae790","resolution":{"observed_at":"2026-07-02T13:16:57.915100Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:52:59.583352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:52:59.583352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.020547Z","title":"2020 , publisher =","venue":null,"work_id":"7135a56c-484f-4d96-a7b8-b87913a91108","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:8444f762821b8f79d52db9596afcc4033d200b494848ee923f5f6d9691691998","observation_id":"b66a9f6f-bcca-4353-ae60-d7e6b2f93e5f","resolution":{"observed_at":"2026-07-06T01:21:44.021643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.61","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Glot500: Scaling multilingual corpora and language models to 500 languages","venue":null,"work_id":"60968378-4f87-45f2-95a0-457d9dbf0077","year":2023},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:def73620e4bbe07e2c76f0c1d26aa79c00c63c3323b35895bf828729f3bac1ce","observation_id":"765d5a2d-66a2-4b8d-bf43-636e9eaab4bb","resolution":{"observed_at":"2026-07-02T13:16:57.906914Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.021372Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation , year =","venue":null,"work_id":"e8370e46-53fa-4282-86ab-5a6bd80cc91c","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:c407dc86818317648b1b34ac5e02650ec32f1a07cbf7d5489fb0f482f759f056","observation_id":"0e86f9f2-9407-489b-be5e-03c5affab5d2","resolution":{"observed_at":"2026-07-06T01:21:44.022555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.024659Z","title":"2024 , eprint =","venue":null,"work_id":"d715fa7f-76c6-41b0-9f74-86139b94258f","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:d5bac09f7147fc850d2193a0bc7926089e2f7f0fb8aaf608406ef695f7a3a9dd","observation_id":"95518809-440b-431a-b9a6-8dcb086fdc4c","resolution":{"observed_at":"2026-07-06T01:21:44.025665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.038504Z","title":"2025 , eprint =","venue":null,"work_id":"ebe66d83-064e-4f48-ab95-ea078953e369","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:9f81a2feb4e1a7ab4622897e9d993cf2416c2f8411acf474c2ab9ea36d269211","observation_id":"a754aaae-6dc8-472b-af06-b7516e69ff93","resolution":{"observed_at":"2026-07-06T01:21:44.039574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.041704Z","title":"Preliminary Ranking of","venue":null,"work_id":"5883fa8c-3868-4138-a656-49334a9f3c6a","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:54e6a7901a21ca862817bb58989ae0386103809d11048fd82968306e78c32e65","observation_id":"2228b67e-3ddc-4ef1-8401-c8c5fb133a9e","resolution":{"observed_at":"2026-07-06T01:21:44.042738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.023045Z","title":"Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies , pages =","venue":null,"work_id":"a7cd5bef-17ae-40f5-976e-baa511796761","year":2011},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:d7ff8e0a445c3808d38eb93659b72e436cfd9136283538a9257c459a8f4a3d8c","observation_id":"aebae82c-31dc-4cf8-8c29-5caa08926129","resolution":{"observed_at":"2026-07-06T01:21:44.024146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.029797Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":"36f09dac-487c-47fc-9729-9702b65115df","year":2022},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:fe28588c52d26dae3a9aff8b4bd38c668c6a32a61f750797a7c145cf6a09c9f1","observation_id":"eb2d3787-856b-4592-b495-352352e58763","resolution":{"observed_at":"2026-07-06T01:21:44.030984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.035258Z","title":"2023 , doi =","venue":null,"work_id":"2eb09ce3-d8e8-45db-ba73-683ed6a047cc","year":2023},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:5008d9ef599bc19758f339f964747271d3b59c27448508ac689556714cb41f76","observation_id":"158ccd26-0a58-4904-bfd5-e74ac56cd8fa","resolution":{"observed_at":"2026-07-06T01:21:44.036360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.043239Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"1c00a650-f17c-41ab-9bf0-081f3660bb08","year":2019},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:57f5e27500433a2c6d06a55e1de19af585f5cf5c76d7ad69a3c51443b2d59d2c","observation_id":"d317a4a0-2a6e-45d8-93d0-f9a983b7631a","resolution":{"observed_at":"2026-07-06T01:21:44.044356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.969835Z","title":null,"venue":null,"work_id":"93272fe0-58e7-49fd-8136-35a943a53524","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:70757e0267991f1afa0fcc39febd5b0bcea3ae1e6d060f28b3751aaed0a9a5f7","observation_id":"756f735e-5581-4cd3-84d6-fc6cd39a5e9f","resolution":{"observed_at":"2026-07-06T01:21:43.971021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.577","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deduplicating Training Data Makes Language Models Better","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"59f1bbd1-2ddb-4173-821f-545a910ec2aa","year":2022},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:a9b01122bb6ef87043dc2952614c311051407a25200d53462606010517588a4a","observation_id":"eac3be1f-b0c3-44c9-9e84-e75c6850a845","resolution":{"observed_at":"2026-07-02T13:16:57.874102Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-14T17:50:54.596138+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T17:50:54.596138+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.888","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , month = nov, year =","venue":null,"work_id":"a831a4bb-0d11-4613-80df-cd4f9ec64470","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:6db7190d001d23cfb0dae98a40a809e3929eb591b88911268c739adadf306e00","observation_id":"09423398-067b-4a2f-92d4-e1024cf14432","resolution":{"observed_at":"2026-07-02T13:16:57.900094Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.983995Z","title":null,"venue":null,"work_id":"2817f0bc-7785-4cbf-bb8a-458e14d8552b","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:ce09dc8bafc5b1809efc7b6a8a70a738e184143161f197c42ab70766fd637764","observation_id":"4cdd2f01-b7cc-480d-8984-9683596a0787","resolution":{"observed_at":"2026-07-06T01:21:43.985135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.044869Z","title":"Rethinking Multilingual Continual Pretraining: Data Mixing for Adapting","venue":null,"work_id":"e52e702c-5732-4177-9c8a-122bc8edd81b","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:7abdbca71f42d04f393cd768cdee6ae7cf3e57674ea211c58b1008e9ad579ea6","observation_id":"83d8390f-6176-402a-aaf1-30d75d2eeb8c","resolution":{"observed_at":"2026-07-06T01:21:44.046036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.033260Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":"05ac7b6a-ed3b-4be2-82e8-f1ffaaff9d01","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:8f2e8cac07e02035c788b9b53322be6dd25e4ae2335dc027ca6d518048fa3a75","observation_id":"b7ea649b-77fe-4f46-83a3-601787770b22","resolution":{"observed_at":"2026-07-06T01:21:44.034382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.153","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:47:48.784249Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","venue":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","work_id":"08362103-dcc9-4e63-948e-05e60dd2d725","year":2023},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:c7637abe2958ed7b6489a3b14819911013bc7cf51286806b7997e700c1881ec6","observation_id":"079984b6-d0ed-4adf-80d1-349c3ba1a348","resolution":{"observed_at":"2026-07-02T13:16:57.926191Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-03T15:08:48.208433+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T15:08:48.208433+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.112","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen Liu, Fajri Koto, Timothy Baldwin, and Iryna Gurevych","venue":null,"work_id":"4e809b25-18a8-4244-b5c2-00c959a2f84d","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:5e7d3adaac6e74e09642d5c58a5978a215d81b5351d8362820cfe8b22e143d9a","observation_id":"24b7b824-93d0-4cef-8236-33665aacd2fe","resolution":{"observed_at":"2026-07-02T13:16:57.866692Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.757","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling","venue":null,"work_id":"d8f80566-4c3e-4235-8976-b5dfb2921f8b","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:5a59380791511eb578f03615d735f9cbbd1d9bcbdb6faf31dc79d6b4a71812fd","observation_id":"5bc49604-e973-4e12-8ba2-0f325bad7c56","resolution":{"observed_at":"2026-07-02T13:16:57.915870Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.862","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Having Beer after Prayer? Measuring Cultural Bias in Large Language Models","venue":null,"work_id":"a16e1c7e-f6c3-4768-873d-7ef8a61f24ab","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:ea9a8b086d4c83ed0e3357525a372dd9ea13ef47cf3035f3d3f6a50ad19e4b55","observation_id":"5fa083b6-4851-4243-858e-480b7236b435","resolution":{"observed_at":"2026-07-02T13:16:57.870104Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:04.650779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:04.650779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.955564Z","title":"and Nguyen, Thien Huu","venue":null,"work_id":"85bb1c86-b005-458b-9068-a9688172b06b","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:86f6b66b07038e0a2ee3f84a936250d6c89fc3be337263b857bc36e0bd14cf16","observation_id":"d4d46596-608c-4737-b11e-3202fc87b0fe","resolution":{"observed_at":"2026-07-06T01:21:43.956668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.973677Z","title":"Nature , volume =","venue":null,"work_id":"9529311e-05ae-4c77-938f-f26cbd7ff371","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:f72471b33d9f25f402dded14f5d020bc106cf94ee9ea9f6661dc2f1cb65e7a8d","observation_id":"40a49b73-076f-452e-9535-17041fdb8d03","resolution":{"observed_at":"2026-07-06T01:21:43.974860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:06:52.912035Z","title":null,"venue":null,"work_id":"73874361-a387-4b1c-b96b-3d5ef79428a9","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:a9fa4f1df33b22c9ff03fe486ac0d8dcc2767f2eece63950049cafe28be5dc58","observation_id":"322f4145-1ef7-430e-8b6a-57f6c9ad978e","resolution":{"observed_at":"2026-07-06T01:21:43.967892Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.026138Z","title":"Computational Linguistics , volume =","venue":null,"work_id":"f640cd85-8e0e-4b4a-874c-1b21c825905a","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:c7d641db05440723051c9528e3d058bcdce9a04c3e9b336fe1e7ed391bb94692","observation_id":"3db15e0e-14c5-4e9d-9c73-4022143e93a3","resolution":{"observed_at":"2026-07-06T01:21:44.027342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.942462Z","title":null,"venue":null,"work_id":"936805fc-a837-444f-a804-03c2d38447ca","year":2023},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:fe947fa17c3d5c08ec595a99bd299e33968b027d7fb219abf098ea8b3e60c036","observation_id":"139045d0-17f7-4055-aaf4-9ded7e5b13df","resolution":{"observed_at":"2026-07-06T01:21:43.943981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.040083Z","title":"CoRR , volume =","venue":null,"work_id":"96b41035-865e-4ede-ac81-71884a48dcde","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:1a5b1eaa7d5139506fb4c988257a3f74d0626af4b85d88f7992153b79f284bc7","observation_id":"527b3a63-2ad6-42c9-a0be-1b4b2bdfdcd6","resolution":{"observed_at":"2026-07-06T01:21:44.041206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.946403Z","title":"2026 , publisher =","venue":null,"work_id":"ac5d887f-5618-4b6e-8b18-0b07fae1e478","year":2026},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:92392b511850b2d920c3e03bd5a3afed8db72526b8bb4f0f497c14a1271d5e8b","observation_id":"5fbbbe16-28a0-414b-9107-82637b0410c6","resolution":{"observed_at":"2026-07-06T01:21:43.947528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.005033Z","title":"Journal of Machine Learning Research , volume =","venue":null,"work_id":"f56bf14b-23cc-44fb-8570-db7662b72ab6","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:ba94daaa114b3dfb62d7082b6ccf1dee75402e6775d691fcb9269e9b29224122","observation_id":"dd4551a1-a1bf-43e2-8ab2-187cdf35bf39","resolution":{"observed_at":"2026-07-06T01:21:44.006211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.691","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Translationese as a Language in ``Multilingual''","venue":null,"work_id":"fb303fc4-68d9-4361-acc4-a5578e1d5bd7","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:2c120fec9ddb9cf5d86872bc39c384a721b7c90303e8403fe319dd131aee6663","observation_id":"cfef988f-0481-4b15-aede-dea4df5801e0","resolution":{"observed_at":"2026-07-02T13:16:57.884099Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.006995Z","title":"CoRR , volume =","venue":null,"work_id":"b69e2ff3-7215-49f7-9cd8-0312cd41d7cd","year":2021},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:5042b24a9847a7bcaac5933955388668a33644aabd240ace25a60b3163da6721","observation_id":"3f30e331-ab03-4180-a0b5-526ab79588ee","resolution":{"observed_at":"2026-07-06T01:21:44.008068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.027049Z","title":null,"venue":null,"work_id":"cbd98aef-5293-4fd1-a353-294d4381fc75","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:357a36d598b142dc291a1307715224734c71fbc34a29bacb1230528c1156e4fe","observation_id":"2a7ee845-0ed1-4816-9b25-e1df33ebb723","resolution":{"observed_at":"2026-07-06T01:21:44.028069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.017154Z","title":"2022 , doi =","venue":null,"work_id":"00f46c8e-086c-4293-a13e-fb6fe2d1b40e","year":2022},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:e8982099c1387b914f0582fb95a57a324b6bd9d6b7e02f3a89a401c300294ccf","observation_id":"704490ae-a86e-4abb-8b87-bc5938aa25b8","resolution":{"observed_at":"2026-07-06T01:21:44.018264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.999586Z","title":"Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"3172156f-16d6-490a-86a1-e17d24606e78","year":2016},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:4bdf88006b060acc5891e93badbd684d4aab7d2265ef9cae98abe5daf7fc04e6","observation_id":"bf23c7cb-a70f-456e-aaf3-6173c4b1723f","resolution":{"observed_at":"2026-07-06T01:21:44.000814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:edef90465fd2efd6f3014fc3f62a826b5bdeef978f2aaab5c95a29a9d20b1e56","observation_id":"fd18870b-ebe7-4d86-91f6-677dc74517e0","resolution":{"observed_at":"2026-07-02T13:16:58.131717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.919","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Global MMLU : Understanding and addressing cultural and linguistic biases in multilingual evaluation","venue":null,"work_id":"0a2c3c6a-1e4f-47c5-b0ed-0b0c1ff513d0","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:2aa29a4fa37ec6cf931216fefb0542688fd3cb4b41775a148c18e491077d4f80","observation_id":"e04c56ea-5cb5-4bf6-a08b-8ecef116ac8b","resolution":{"observed_at":"2026-07-02T13:16:57.888494Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.994840Z","title":"Democratizing neural machine translation with","venue":null,"work_id":"7a1b1f10-4255-46d2-aab6-33a5f6bbcad8","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:6f06fc409b25b5a29fc02ad99d5ae2dbe5bfda6b5a693467f5385d14e77175cf","observation_id":"749f551f-3010-4d11-956a-9b78862ecf95","resolution":{"observed_at":"2026-07-06T01:21:43.996086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.987555Z","title":"Proceedings of the 22nd Annual Conference of the European Association for Machine Translation , year =","venue":null,"work_id":"a7a67ffb-4f23-4c82-867f-a02ff8cac967","year":null},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:16dc0d0fa8fdf15a9f1110a5cdf7d6b20dd0c5d06da613b2f44e06078c94d822","observation_id":"3128f222-b195-4167-be03-f4557c16bd6d","resolution":{"observed_at":"2026-07-06T01:21:43.988925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.235","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Not Enough Data to Pre-train Your Language Model?","venue":null,"work_id":"91e45f93-a469-466b-b051-300662ec7ff2","year":2023},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:eb424bd04368f90cef62d581610fa8a00f6f9825f08625bae6df40da01d7c793","observation_id":"9c728279-f9d3-4951-8078-3d1e7818ac9b","resolution":{"observed_at":"2026-07-02T13:16:57.931193Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.eacl-main.188","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Translationese: Effects of Algorithmic Bias on Linguistic Complexity in Machine Translation","venue":null,"work_id":"6dc9726e-44a7-4b27-b283-d9886a71bae9","year":2021},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:c53eb548b4eda587db940c2c604ed60e7fa061f661811ccd9faa368df9c99f3a","observation_id":"41b44281-7f1a-4b17-a230-82422917b6c2","resolution":{"observed_at":"2026-07-02T13:16:57.891064Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.mrl-main.40","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 5th Workshop on Multilingual Representation Learning , month = nov, year =","venue":null,"work_id":"012c3023-57da-4c15-976f-0f00b44eeeb5","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:e23754f04373b85dd043221e1d2002d8eb85cb9a5eb9bc4e4769605cf87aa3ea","observation_id":"e2fb1d9c-ec0b-4c40-ae94-a61e4dd1a6d9","resolution":{"observed_at":"2026-07-02T13:16:57.902483Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.036836Z","title":"Replacing Judges with Juries: Evaluating","venue":null,"work_id":"ea2c5f16-b1f7-4702-9092-57e2cd8c1507","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:c630736eb9a9f5143b7104411ce2dd61388e9b800439b92e8123217fe5c0f6b2","observation_id":"b2b00ca6-2d1e-44d5-8090-685df72690ff","resolution":{"observed_at":"2026-07-06T01:21:44.038031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:44.027845Z","title":"Digital Scholarship in the Humanities , volume =","venue":null,"work_id":"26c0c967-60b2-48f9-9fe3-dc7946e741a0","year":2015},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:276541fbf5cc326e73cc7aebc919d47ac2645f089c323439d091252a02b60343","observation_id":"a96b65c5-5aee-4701-b16c-c6f5893c60e6","resolution":{"observed_at":"2026-07-06T01:21:44.029230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.1426","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , month = nov, year =","venue":null,"work_id":"90d81908-30be-4def-93b6-c1c2e0ef17c6","year":2025},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:67843a13b9a2771b85e271779604cb6c47f40c77e50d190aeaaa4d1decf5479b","observation_id":"0ca5c0b3-5222-42ea-b609-9104846f9f84","resolution":{"observed_at":"2026-07-02T13:16:57.896676Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.998793Z","title":"CoRR , volume =","venue":null,"work_id":"1f29c323-3dca-49c7-9285-52416131bf66","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:4236be27e3530aba1763f2adc51f5ccd882057863af8550dadf67741f8381ef7","observation_id":"02cafa7c-8771-4cdf-bbad-4594b4a32e4a","resolution":{"observed_at":"2026-07-06T01:21:43.999916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1159","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages =","venue":null,"work_id":"3de231df-f5d5-476d-a815-7ff6b4f87c48","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:f79890ecf1552e54d135e93cb7a362d98ccca26b6c2a3327aeec1e785b9ecfb8","observation_id":"00baf76d-cb4b-415e-8be5-6d1b3f39dffc","resolution":{"observed_at":"2026-07-02T13:16:57.898329Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.987375Z","title":"Proceedings of the Twelfth Language Resources and Evaluation Conference , pages =","venue":null,"work_id":"e950744c-e1ec-4c9b-a90b-9494bf5e55b2","year":2020},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:c78ef47574f6c8b60502994f17f5e677babf33cb4811eea48272948a3e8196bf","observation_id":"5095c38e-e20d-4489-9306-dcf6edc6dbe4","resolution":{"observed_at":"2026-07-06T01:21:43.988521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":12,"parse_uncertain":1,"unresolved":7,"verified_exact":23,"verified_fuzzy":57},"total_outbound_references":123},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 123 outbound references and 0 inbound Pith citation observations for arXiv:2607.00890."}