{"as_of":"2026-08-08T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d04ed5f31a59025ccf43f17413156ce883cff9ab02e1c4a3e433d4a35b55b8b3","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:46:42.375506Z","state":"measured"},{"denominator":122,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":122,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:16:45.263479Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-06T18:16:45.263479Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08924","last_updated":"2025-07-18T09:31:19Z","snapshot_observed_at":"2026-08-07T23:55:32.686302Z","submitted_at":"2025-07-11T17:56:32Z","title":"From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:16:45.263479Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2507.08924"},"observation_digest":"sha256:0c9a6a8c2cba03d37335cb8b0b70c186a99b106ad872f60117f08cd437c8dd38","observation_id":"09e337de-4ea6-40da-aabe-c6305c9f5365","resolution":{"observed_at":"2026-08-06T18:16:45.263479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T22:45:15.379631Z","title":"Penedo, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06464","last_updated":"2025-08-08T17:13:00Z","snapshot_observed_at":"2026-08-07T13:11:39.868102Z","submitted_at":"2025-08-08T17:13:00Z","title":"Observation of momentum dependent charge density wave gap in EuTe4","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:45:15.379631Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2508.06464"},"observation_digest":"sha256:996f055ab41da32e5e09856405ba4acae7cfc65166482578b08c1994cb1ccbab","observation_id":"0c6bb196-3a1f-4b67-ae83-0f7f9f57eabe","resolution":{"observed_at":"2026-08-05T22:45:15.379631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T17:50:08.399160Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2508.06471"},"observation_digest":"sha256:7f3a8190ee3f671576eef1feb9d6d3a08ace488052c5d9f8e1ccbc8647b8f5ae","observation_id":"67cc670d-1c49-4e0f-9050-c5fdcc28d126","resolution":{"observed_at":"2026-05-11T17:50:08.479194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T05:42:50.078953Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05060","last_updated":"2025-09-05T12:40:31Z","snapshot_observed_at":"2026-08-07T21:05:41.724125Z","submitted_at":"2025-09-05T12:40:31Z","title":"Entropy2Vec: Crosslingual Language Modeling Entropy as End-to-End Learnable Language Representations","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T05:42:50.078953Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2509.05060"},"observation_digest":"sha256:3828833cf07d6de0d89ba89b9e4d3db58085fcca733a6ae817d1d5d19cc20373","observation_id":"7b73d5d6-df5b-429e-b414-072673213de2","resolution":{"observed_at":"2026-08-05T05:42:50.078953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-03T08:58:50.692729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15251","last_updated":"2026-06-28T17:05:49Z","snapshot_observed_at":"2026-08-07T15:23:55.756107Z","submitted_at":"2026-01-21T18:33:15Z","title":"The Effect of Scripts and Formats on LLM Numeracy","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T08:58:50.692729Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2601.15251"},"observation_digest":"sha256:19d042562e66f6f12ed74f802e05c48bf79dd5d7918ed8c51c68bcbc61de8a27","observation_id":"45b04929-9776-4355-bbde-389fd154ecf0","resolution":{"observed_at":"2026-08-03T08:58:50.692729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-03T08:15:27.454474Z","title":"Fineweb2: One pipeline to scale them all --- adapting pre-training data processing to every language, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-03T08:15:07.553014Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:27.454474Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:9a393affeac6f346786c88fbbf295c658b48326edeb710ca6fd13e9d008f5520","observation_id":"e263f088-3f4e-4306-8aae-d48749d9a534","resolution":{"observed_at":"2026-08-03T08:15:27.454474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-02T23:37:59.719719Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13139","last_updated":"2026-06-18T11:51:21Z","snapshot_observed_at":"2026-08-06T12:04:37.276168Z","submitted_at":"2026-02-13T17:47:08Z","title":"OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T23:37:59.719719Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2602.13139"},"observation_digest":"sha256:e299284a1d7e98b4067fe6d1d2e47dbe82e2d47f3d2542dde0a46ba934dbb8ed","observation_id":"79a8722b-9b1e-435f-9f17-7bc8c9414d93","resolution":{"observed_at":"2026-08-02T23:37:59.719719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-14T21:44:31.429223Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:f97a43f8dd9d4a69e7c2f72d8de65597e1365dd9a8b2f6f1fb0cb185bcd23a40","observation_id":"763e30af-8044-4a58-8526-9f21ffcb16c1","resolution":{"observed_at":"2026-05-14T21:48:00.949304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-19T16:36:30.007014Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:b34e07a3cb7085faacbe12e712139724ad3ea0d4d49dc2c47626e7caab56f4b1","observation_id":"3a3d4225-0be4-4675-bc7f-70b881a3c0a0","resolution":{"observed_at":"2026-05-19T16:37:39.604606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.13225","last_updated":"2026-05-13T09:17:51Z","snapshot_observed_at":"2026-08-02T19:28:51.230887Z","submitted_at":"2026-05-13T09:17:51Z","title":"Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:17:26.661595Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.13225"},"observation_digest":"sha256:4d9ab763779316cf298693327925cc5db9113428f6c52e0b285f6aafeb3dd501","observation_id":"10a7a53c-b215-4103-8017-0c99cb34c20e","resolution":{"observed_at":"2026-05-14T20:19:27.448259Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.13521","last_updated":"2026-05-13T13:37:45Z","snapshot_observed_at":"2026-08-02T12:25:38.200224Z","submitted_at":"2026-05-13T13:37:45Z","title":"Granite Embedding Multilingual R2 Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T18:16:49.148303Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.13521"},"observation_digest":"sha256:3ef01a9430e236c81e1b47aa74aa3e94ee55970e887798c28e5f84b0ec508d08","observation_id":"009b4acd-a370-4dba-a981-20466c2442fe","resolution":{"observed_at":"2026-05-14T18:17:34.932496Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.18083","last_updated":"2026-05-18T08:59:08Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:59:08Z","title":"A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$\\Delta$ Integration into Upcycled MoE","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T11:09:22.027588Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.18083"},"observation_digest":"sha256:923e5d77761b41fab53f6ecc1da4dd55ab50d4b4ce5dd7767f669e5d00de973b","observation_id":"9c65265e-e2be-427e-a18f-c02d71c8ba7e","resolution":{"observed_at":"2026-05-20T11:13:13.616472Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.18232","last_updated":"2026-05-18T11:28:03Z","snapshot_observed_at":"2026-08-02T05:44:45.308802Z","submitted_at":"2026-05-18T11:28:03Z","title":"SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T10:34:49.783942Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.18232"},"observation_digest":"sha256:c5ee9b00580be6dd4c6d33f1669898dadc2b7b8a6645704c4c902f5d85ebdac3","observation_id":"55dab8fb-b24c-476f-a89e-a007b018028b","resolution":{"observed_at":"2026-05-20T10:38:12.634240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.23885","last_updated":"2026-05-22T17:45:49Z","snapshot_observed_at":"2026-08-07T20:04:03.433745Z","submitted_at":"2026-05-22T17:45:49Z","title":"Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-25T04:11:06.312503Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.23885"},"observation_digest":"sha256:66741ffafc4bfe053c0d6e12e203eb489f2b152c54359e56aef0c7cb6823c191","observation_id":"ed65c45e-2831-430a-8d11-502aa052c297","resolution":{"observed_at":"2026-05-25T04:15:20.257197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2605.25263","last_updated":"2026-05-24T21:26:47Z","snapshot_observed_at":"2026-08-07T14:02:17.175900Z","submitted_at":"2026-05-24T21:26:47Z","title":"Mimir: Large-scale Multilingual Concept Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T11:08:44.027943Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2605.25263"},"observation_digest":"sha256:1a8de6a9cfd85ad202ba8f779000e495f58af03774b0062ef3d47a78e5095c1f","observation_id":"cf0129b7-a60b-40ca-9fb4-83adcd620143","resolution":{"observed_at":"2026-06-30T11:24:38.681356Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2606.08545","last_updated":"2026-06-07T09:55:59Z","snapshot_observed_at":"2026-07-30T09:10:11.447903Z","submitted_at":"2026-06-07T09:55:59Z","title":"Ishigaki-IDS: An Open-Weight Verifier-Aware Model for Information Delivery Specification Drafting in Building Information Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T18:24:53.592902Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2606.08545"},"observation_digest":"sha256:4cf6b02aa0f501c6137bff0fe457da8aafb42cf19d575d12715ddd2e311a23e8","observation_id":"57f65719-6f44-406a-861c-fcf0faa9aabd","resolution":{"observed_at":"2026-07-02T23:17:29.057127Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2606.20945","last_updated":"2026-06-23T11:48:31Z","snapshot_observed_at":"2026-07-06T23:56:02.397254Z","submitted_at":"2026-06-18T21:18:42Z","title":"Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T17:40:06.036019Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2606.20945"},"observation_digest":"sha256:317568f64ef75515c993efef25e1861ce662e9fd93d8cba6acef1e152ad6f5d2","observation_id":"df6a9db1-36aa-41d6-b236-56f1861d6a01","resolution":{"observed_at":"2026-07-04T03:49:29.893255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2606.22722","last_updated":"2026-06-21T23:44:47Z","snapshot_observed_at":"2026-08-01T20:09:39.892398Z","submitted_at":"2026-06-21T23:44:47Z","title":"moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T10:07:55.521194Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2606.22722"},"observation_digest":"sha256:7371108035b1ec3462ddbd8d608450aedfb857df7804e126549e7c10f81bfb28","observation_id":"d2bd763f-f994-4834-9947-29e54e4eb04e","resolution":{"observed_at":"2026-07-04T09:19:44.124861Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2606.23566","last_updated":"2026-06-23T17:41:34Z","snapshot_observed_at":"2026-08-02T17:04:44.797294Z","submitted_at":"2026-06-22T16:32:00Z","title":"LangMAP: A Language-Adaptive Approach to Tokenization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-26T08:26:33.185340Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2606.23566"},"observation_digest":"sha256:e0a119f90cd466bb5e1b71ce7b19fa9abff44af395f3d1e37a90a098c317d65e","observation_id":"1b5b1bdb-58fb-408b-9c29-2bf74907bb15","resolution":{"observed_at":"2026-07-04T10:49:46.653379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2606.25821","last_updated":"2026-06-24T13:36:46Z","snapshot_observed_at":"2026-08-02T15:18:54.744792Z","submitted_at":"2026-06-24T13:36:46Z","title":"SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-25T20:48:04.003465Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2606.25821"},"observation_digest":"sha256:c3e3863a322c8a7526e45baaa0f6461b2a90f68e3d9b91fcc8ed55b6389586ff","observation_id":"d3e45960-722e-4f56-bb55-437ffa4ab47a","resolution":{"observed_at":"2026-07-04T20:00:09.022875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":"2506.20920","doi":"10.48550/arxiv.2506.20920","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fineweb2: One pipeline to scale them all -- adapting pre-training data processing to every language","venue":"ArXiv.org","work_id":"8c1a96bf-50f6-4e4a-b724-e61bee88277d","year":2025},"citing_paper":{"arxiv_id":"2606.28057","last_updated":"2026-06-26T13:03:29Z","snapshot_observed_at":"2026-08-02T04:58:16.992176Z","submitted_at":"2026-06-26T13:03:29Z","title":"MultiHashFormer: Hash-based Generative Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T04:13:05.082903Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2606.28057"},"observation_digest":"sha256:945d17929c8efaa03f2c7bea5306aebc902256dd104e1c939af3f4997b2d1739","observation_id":"65447489-0aee-4602-976e-e5023ff38cb3","resolution":{"observed_at":"2026-06-29T04:23:05.508816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-01T23:50:16.706422Z","title":"FineWeb2: One pipeline to scale them all – adapting pre-training data processing to every language.arXiv preprint arXiv:2506.20920,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-07T21:52:25.478810Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.706422Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:c75aba64d87b8a038661798e9ae1c564cc2a986dde47575f5ac3bf28a5417734","observation_id":"a12afaeb-34ce-473a-91f9-9ad1b79e3171","resolution":{"observed_at":"2026-08-01T23:50:16.706422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20920/citation-record","integrity":"/paper/2506.20920/integrity","json":"/paper/2506.20920/citation-record.json","paper":"/paper/2506.20920"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-06T22:46:33.435145Z","title":"Yi: Open foundation models by 01.ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.435145Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f62b496b6e4ad891ff8d9e3f8d46d5c48dd16a5732a07fc3e7467730ae3878ed","observation_id":"5ec22fa5-a012-41c0-82da-f189097500a9","resolution":{"observed_at":"2026-08-06T22:46:33.435145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T22:46:33.489072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.489072Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:a20ff26f01f042c84ea23c2a5cb8ee91b3397e1860745fb44b332fb3d814aea3","observation_id":"93645589-9dc1-4d2a-8128-c1a94669f570","resolution":{"observed_at":"2026-08-06T22:46:33.489072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:33.557062Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.557062Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f32f43c61da49112dabf17d8bd46869f7af87578087ea742b29317456a07ebd0","observation_id":"6894d93a-aa44-48df-8279-75e4b1f5b8f6","resolution":{"observed_at":"2026-08-06T22:46:33.557062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:33.625972Z","title":"A survey on data selection for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.625972Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:466487aab88485dcd4f9ca4a640b727e8280d75c2d55f2b525f5fddb5c9cfdd9","observation_id":"9b2b22c6-7c9f-43bf-b997-1ec8c9115267","resolution":{"observed_at":"2026-08-06T22:46:33.625972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:33.702254Z","title":"Open llm turkish leaderboard v0.2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.702254Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:4e8f6d50832a0875bbb1a81e7af3634a0c5a9e7e04878d1a0059fed1c4dd9bf1","observation_id":"767dab6a-c430-4bea-a8fa-31aa9e767aec","resolution":{"observed_at":"2026-08-06T22:46:33.702254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:33.797026Z","title":"A l G hafa evaluation benchmark for A rabic language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.797026Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:23a2e789b1d3e6646a102724fc15d346dbd876cb8c318e952e2f5c996fc8bf8c","observation_id":"a1f05eab-e33f-40fb-977c-3aac94923944","resolution":{"observed_at":"2026-08-06T22:46:33.797026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:33.843819Z","title":"101 billion arabic words dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.843819Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:837ee65cc98bb26d2623783506f2eec446a4f94e97000c291734dc7e87096877","observation_id":"c00582aa-05a4-47a7-96da-83d765789020","resolution":{"observed_at":"2026-08-06T22:46:33.843819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:33.881227Z","title":"On the cross-lingual transferability of monolingual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.881227Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:79e2505cdd4a22536cebb1f36d2a6d77a890b5f1df3aca0ad59e1750fb4a7e57","observation_id":"20cce32f-fab4-43bc-8d2e-76412bc7fc45","resolution":{"observed_at":"2026-08-06T22:46:33.881227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.658","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:43.817356Z","title":"A call for more rigor in unsupervised cross-lingual learning","venue":null,"work_id":"f0ee3254-dbdc-4e23-94f4-0315e8aee60b","year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.948108Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:04a5a268b53181cea8babda276cae7bc7040b75330f84b36d018b0ca61ead2e1","observation_id":"67eaca72-07bb-4902-b2db-fa169d3747a0","resolution":{"observed_at":"2026-08-06T22:46:43.869917Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:33.995458Z","title":"Japanese massive multitask language understanding benchmark, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:33.995458Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:062eee2fd84286b9df589e5e7d5ebdb5810f9a400761238e6c824f5aab32fdc0","observation_id":"fd5889bf-fa8d-4af2-aa2b-5ae7d4a83975","resolution":{"observed_at":"2026-08-06T22:46:33.995458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:34.075955Z","title":"The belebele benchmark: a parallel reading comprehension dataset in 122 language variants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.075955Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:56493e9a9dca442400d3967f04e5c02f0a904dcd6b3953799b77cd621edbfbcb","observation_id":"9b0d82cf-0d66-40f5-8a0e-da42bf5d4814","resolution":{"observed_at":"2026-08-06T22:46:34.075955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03983","last_updated":"2022-07-06T19:51:48Z","snapshot_observed_at":"2026-07-06T13:07:52.032502Z","submitted_at":"2022-05-09T00:24:13Z","title":"Building Machine Translation Systems for the Next Thousand Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.03983","snapshot_observed_at":"2026-08-06T22:46:34.150087Z","title":"Building machine translation systems for the next thousand languages, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.150087Z"},"links":{"cited_paper":"/paper/2205.03983","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:2bb108829c4c23ff0adcfe01d072c8fd323c4c5b263f6f0b460201ee79fb22a2","observation_id":"2d29a952-39ae-463d-87d5-d28ef38c1316","resolution":{"observed_at":"2026-08-06T22:46:34.150087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:34.210423Z","title":"Trafilatura: A Web Scraping Library and Command-Line Tool for Text Discovery and Extraction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.210423Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:57b1b871c7ec30a96aaaa93ad7af112dffd26821b7db1b42b72abf5fa688ced5","observation_id":"aee1a052-c635-4462-b70b-a26749d0af24","resolution":{"observed_at":"2026-08-06T22:46:34.210423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:34.319292Z","title":"On the resemblance and containment of documents","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.319292Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:a6174e230adcbaf20de2f7829938cd7513071489e753aaeb9b095fe8bf0966b3","observation_id":"c3578c5c-d4c7-49a8-a653-2ca0dfa9d86e","resolution":{"observed_at":"2026-08-06T22:46:34.319292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:34.474853Z","title":"An open dataset and model for language identification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.474853Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:921e589abf4117dee19538ca36959fce9d7e2613cc7ca514ee969dcbed3d7884","observation_id":"ead3e28e-4569-40f6-878e-666442a5ef75","resolution":{"observed_at":"2026-08-06T22:46:34.474853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10267","last_updated":"2025-06-04T12:57:58Z","snapshot_observed_at":"2026-08-07T17:07:24.459489Z","submitted_at":"2025-03-13T11:24:09Z","title":"An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10267","snapshot_observed_at":"2026-08-06T22:46:34.583082Z","title":"An expanded massive multilingual dataset for high-performance language technologies, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.583082Z"},"links":{"cited_paper":"/paper/2503.10267","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:9bf6720f128ccf189edc2c9a264f2fcbcbc6b706062e4dee3672fe0e3e3fb5ee","observation_id":"6f6c3cb5-c38d-4cce-b6f4-f6f4b634ed5a","resolution":{"observed_at":"2026-08-06T22:46:34.583082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.09144","last_updated":"2020-10-08T18:37:54Z","snapshot_observed_at":"2026-08-03T13:36:59.396944Z","submitted_at":"2020-08-20T18:10:13Z","title":"PTT5: Pretraining and validating the T5 model on Brazilian Portuguese data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.09144","snapshot_observed_at":"2026-08-06T22:46:34.736671Z","title":"PTT5 : Pretraining and validating the t5 model on brazilian portuguese data","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.736671Z"},"links":{"cited_paper":"/paper/2008.09144","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:91d9a48b9865e927c407a3f033c26cdc7b38702c0091324d8e76317e672b074d","observation_id":"51c0b978-de55-4141-810a-32a5f05bf112","resolution":{"observed_at":"2026-08-06T22:46:34.736671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:34.831748Z","title":"Language ID in the wild: Unexpected challenges on the path to a thousand-language web text corpus","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.831748Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:20537693c3a3ae33bee16f2226876527455bfefa2fa0c329456b996c680025eb","observation_id":"d97dbaa2-3c1b-4e30-bb53-124de1eeb969","resolution":{"observed_at":"2026-08-06T22:46:34.831748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:34.988316Z","title":"Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, and Jennimaria Palomaki","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:34.988316Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f344fef72370dd4a9a525ec792ee003777d963fbf312370975d589e8b63d78a9","observation_id":"f48cd5d1-bcbe-49cb-8ec9-074466a7393e","resolution":{"observed_at":"2026-08-06T22:46:34.988316Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:35.082235Z","title":"Command r+","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.082235Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f53580e887d08057df6065f647cb61ce7bcd11a9960036db468809e241a5da6d","observation_id":"a73efc9f-d303-4a64-a261-dd8ea894f2dd","resolution":{"observed_at":"2026-08-06T22:46:35.082235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.ac","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:43.696291Z","title":"Unsupervised cross-lingual representation learning at scale","venue":null,"work_id":"d533c632-38d9-4cb9-850b-bba64af5e00e","year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.190771Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:e995fdd13c9b67832e48549ce8860611f590196cf214410e51ae85238ce800be","observation_id":"204dfc02-b923-4ba9-85cb-9b4525f83964","resolution":{"observed_at":"2026-08-06T22:46:43.742969Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:35.333775Z","title":"Neural learning for question answering in italian","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.333775Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:93f3e9974a739b46a81d5b5b3cc96b20a3cb1106bfe1447f0735e88dd436412d","observation_id":"ebfebb77-afd4-4762-8ae6-1ec465b2ef68","resolution":{"observed_at":"2026-08-06T22:46:35.333775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.08299","last_updated":"2018-03-15T09:22:50Z","snapshot_observed_at":"2026-07-06T06:01:08.155772Z","submitted_at":"2017-09-25T03:14:01Z","title":"Dataset for the First Evaluation on Chinese Machine Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1709.08299","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.08299","snapshot_observed_at":"2026-08-06T22:46:44.973226Z","title":"Dataset for the First Evaluation on Chinese Machine Reading Comprehension","venue":"cs.CL","work_id":"3c068ad6-a745-4c9f-b6a4-5b2bda71247c","year":2017},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.445116Z"},"links":{"cited_paper":"/paper/1709.08299","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:5dbabe1c7c31204f22765612af39a179688205d1e8ac270acc82a00c8f057319","observation_id":"df62415c-318d-40c7-80cc-884a41aa911f","resolution":{"observed_at":"2026-08-06T22:46:45.068840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:35.543260Z","title":"Daniels and William Bright (eds.)","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.543260Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:bc660104dcb14aa006760fa0e25971b6e37f0407d65ce7cc5df8b693da84fa6d","observation_id":"504fbcb6-49c0-4587-9919-3ba7ae8ddc77","resolution":{"observed_at":"2026-08-06T22:46:35.543260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14009","last_updated":"2024-03-20T22:14:39Z","snapshot_observed_at":"2026-07-06T17:47:59.544888Z","submitted_at":"2024-03-20T22:14:39Z","title":"A New Massive Multilingual Dataset for High-Performance Language Technologies","version":1},"cited_work":{"arxiv_id":"2403.14009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14009","snapshot_observed_at":"2026-08-06T22:46:44.858079Z","title":"A New Massive Multilingual Dataset for High-Performance Language Technologies","venue":"cs.CL","work_id":"979a2169-124d-4b65-8dbc-3368f52f0934","year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.727398Z"},"links":{"cited_paper":"/paper/2403.14009","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:e62aef6dd00845ca05dac4f7455dcafef293b5823fe88a1372ce316b58859613","observation_id":"75a59b1b-7199-4d01-ba28-fac54f1e3df1","resolution":{"observed_at":"2026-08-06T22:46:44.888181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.09582","last_updated":"2019-12-19T22:59:26Z","snapshot_observed_at":"2026-07-06T08:45:52.985146Z","submitted_at":"2019-12-19T22:59:26Z","title":"BERTje: A Dutch BERT Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.09582","snapshot_observed_at":"2026-08-06T22:46:35.817846Z","title":"BERTje : A dutch BERT model","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.817846Z"},"links":{"cited_paper":"/paper/1912.09582","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:32d1215bd923464e31100246b0ab276864b439ab29b51698ccd7971d3eeb31ad","observation_id":"ed081d84-e88a-4f48-92f3-42000a1ef7c8","resolution":{"observed_at":"2026-08-06T22:46:35.817846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T22:46:35.894130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.894130Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:b5084e3328be34c106a0f212f3ec55648642e024a9d99b8f5c11b0c7a985cada","observation_id":"488d3324-dc9d-45c4-a85d-3f57bcfdbcf5","resolution":{"observed_at":"2026-08-06T22:46:35.894130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06286","last_updated":"2020-09-16T13:42:16Z","snapshot_observed_at":"2026-07-06T08:51:11.583684Z","submitted_at":"2020-01-17T13:25:44Z","title":"RobBERT: a Dutch RoBERTa-based Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06286","snapshot_observed_at":"2026-08-06T22:46:35.985633Z","title":"RobBERT : a dutch RoBERTa -based language model","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:35.985633Z"},"links":{"cited_paper":"/paper/2001.06286","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:805471cf11c4412b0cf47d981075534943c774a9fe13870821ae1327c30fd8e2","observation_id":"579cc685-a676-4f08-aa87-8aeca05345ef","resolution":{"observed_at":"2026-08-06T22:46:35.985633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06071","last_updated":"2020-05-25T17:09:17Z","snapshot_observed_at":"2026-07-06T08:57:20.804732Z","submitted_at":"2020-02-14T15:23:38Z","title":"FQuAD: French Question Answering Dataset","version":2},"cited_work":{"arxiv_id":"2002.06071","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.06071","snapshot_observed_at":"2026-08-06T22:46:44.648817Z","title":"FQuAD: French Question Answering Dataset","venue":"cs.CL","work_id":"04ebd2b7-31ac-48b9-b5e1-b013b5ade52e","year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.078826Z"},"links":{"cited_paper":"/paper/2002.06071","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:55336e826aeaa7b6a92773933ceabdfb66aa396da7c769764cb84f02bf90af32","observation_id":"48891c63-e204-485a-b9db-06320ce3391e","resolution":{"observed_at":"2026-08-06T22:46:44.741197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12982","last_updated":"2025-02-18T16:04:57Z","snapshot_observed_at":"2026-08-07T18:08:01.804292Z","submitted_at":"2025-02-18T16:04:57Z","title":"Sailor2: Sailing in South-East Asia with Inclusive Multilingual LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12982","snapshot_observed_at":"2026-08-06T22:46:36.172908Z","title":"Tran, Mike Zhang, Shiqi Chen, Tianyu Pang, Chao Du, Xinyi Wan, Wei Lu, and Min Lin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.172908Z"},"links":{"cited_paper":"/paper/2502.12982","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:b813520854aae94b380953a9dff985cdf9a45e34523e1333650df83d814f948d","observation_id":"bf5d4220-13a8-4211-ae7c-eab29ffc1d12","resolution":{"observed_at":"2026-08-06T22:46:36.172908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04167","last_updated":"2024-09-13T09:47:29Z","snapshot_observed_at":"2026-08-04T12:40:40.402292Z","submitted_at":"2024-04-05T15:20:02Z","title":"Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04167","snapshot_observed_at":"2026-08-06T22:46:36.260283Z","title":"Chinese tiny llm: Pretraining a chinese-centric large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.260283Z"},"links":{"cited_paper":"/paper/2404.04167","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:df1f04fce5f2d41b2544b127e6d6e0ac0f22bf1a2bae40d6056e21d9f81fee9d","observation_id":"96fee737-29a8-477b-b0ed-85d088c6a9fc","resolution":{"observed_at":"2026-08-06T22:46:36.260283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:36.357550Z","title":"Eberhard, Gary F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.357550Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:37686876deaccb2bfb724094c9800a79d4169a6af365bc7e1887ed1e82f42ea2","observation_id":"c3edfc52-178b-4997-99d4-9ae23425345f","resolution":{"observed_at":"2026-08-06T22:46:36.357550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:36.484014Z","title":"SberQuAD – Russian Reading Comprehension Dataset: Description and Analysis, pp.\\ 3–15","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.484014Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:35e411db4e26600e3935696489b1666cb1375597ad0082a4ad5ce39bc2a1d317","observation_id":"086ea4a7-24ab-48bc-a1e0-83a70fe57691","resolution":{"observed_at":"2026-08-06T22:46:36.484014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:36.563221Z","title":"Arabicweb24: Creating a high quality arabic web-only pre-training dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.563221Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:6e48ff7eded992691f423701301cc7c18bed52a2a979f1b52208f1ddce8a372a","observation_id":"4f6ba979-b408-4848-b114-102f4590aae4","resolution":{"observed_at":"2026-08-06T22:46:36.563221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:36.638830Z","title":"Guerreiro, António Loison, Duarte M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.638830Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:3130856c74d39fad88a806d7c99ff6a0a9eba6b41f24a2b5613e1f5739eabd7e","observation_id":"44f6f449-cb49-424c-803c-bad6e90723f9","resolution":{"observed_at":"2026-08-06T22:46:36.638830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04531","last_updated":"2024-08-02T13:23:18Z","snapshot_observed_at":"2026-07-06T17:13:17.263599Z","submitted_at":"2024-01-09T12:55:21Z","title":"MERA: A Comprehensive LLM Evaluation in Russian","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04531","snapshot_observed_at":"2026-08-06T22:46:36.710892Z","title":"Mera: A comprehensive llm evaluation in russian, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.710892Z"},"links":{"cited_paper":"/paper/2401.04531","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:e9b889c27ca212e994e509e07dc6b74e8cf60479f7454feeb5e81c11aae56ba8","observation_id":"be88cc1e-59c7-4bed-bca5-0a003eddfb9e","resolution":{"observed_at":"2026-08-06T22:46:36.710892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:36.843320Z","title":"Open llm leaderboard v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.843320Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:90a6bd9a2fca4e06b59fae811a7560c36cfd3de332aa771520f73dfc88fad9f1","observation_id":"4fd9627c-c59c-4bd2-9299-0f896ee29e4e","resolution":{"observed_at":"2026-08-06T22:46:36.843320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T22:46:36.956706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:36.956706Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:982f1c4b1989ee43acb0904b84437cf1dda5d13242ec68d9d2be9653e7072c19","observation_id":"fb661be8-d0a6-4bce-a8a6-859bc397a9bf","resolution":{"observed_at":"2026-08-06T22:46:36.956706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:46:37.083695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.083695Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:63add6026ba2cd5255ee18fdf5fc5054a9f1b39935e54a6b1e5e8b9ef4bc3ba0","observation_id":"981672ec-3d2a-4080-855f-8cb4f19284c7","resolution":{"observed_at":"2026-08-06T22:46:37.083695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03296","last_updated":"2023-08-07T04:47:42Z","snapshot_observed_at":"2026-07-06T16:03:14.694457Z","submitted_at":"2023-08-07T04:47:42Z","title":"Studying Large Language Model Generalization with Influence Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03296","snapshot_observed_at":"2026-08-06T22:46:37.222530Z","title":"Studying large language model generalization with influence functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.222530Z"},"links":{"cited_paper":"/paper/2308.03296","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:ec60743c3beb3dc5e51991539b0be413f6159bb595e98f8cb3359f93df39f8e6","observation_id":"94c3acd5-d761-4e6b-9598-f18da8e52e00","resolution":{"observed_at":"2026-08-06T22:46:37.222530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08446","last_updated":"2025-02-11T18:59:26Z","snapshot_observed_at":"2026-08-06T16:31:19.141189Z","submitted_at":"2024-06-12T17:37:09Z","title":"OLMES: A Standard for Language Model Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08446","snapshot_observed_at":"2026-08-06T22:46:37.365791Z","title":"Olmes: A standard for language model evaluations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.365791Z"},"links":{"cited_paper":"/paper/2406.08446","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:92efc5bbb9e4809c86c228292b63e2e0800da01addf41f88a57705eca4cf2941","observation_id":"7072c36e-25f9-4ad5-9295-6e4aa128b307","resolution":{"observed_at":"2026-08-06T22:46:37.365791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.03080","last_updated":"2020-11-05T20:06:50Z","snapshot_observed_at":"2026-07-06T10:12:05.103366Z","submitted_at":"2020-11-05T20:06:50Z","title":"EXAMS: A Multi-Subject High School Examinations Dataset for Cross-Lingual and Multilingual Question Answering","version":1},"cited_work":{"arxiv_id":"2011.03080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.03080","snapshot_observed_at":"2026-08-06T22:46:44.444395Z","title":"EXAMS: A Multi-Subject High School Examinations Dataset for Cross-Lingual and Multilingual Question Answering","venue":"cs.CL","work_id":"f6b56a0e-095d-44aa-84ec-99ab0243fa68","year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.521847Z"},"links":{"cited_paper":"/paper/2011.03080","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:e91023b7cf8de6eef86a6291768e1a7194fcb189efcc2c8cd771c5759d5f2844","observation_id":"9a33ca50-0ec2-4830-a8ab-8355fa9c5c2c","resolution":{"observed_at":"2026-08-06T22:46:44.529872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:37.613762Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.613762Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:ee5c527d982d3f6b48be1996b9f3c5d0dde30e61562a5f17c16adaed1f016e7c","observation_id":"1d7babeb-2c21-4c95-8506-9831e9a7cab5","resolution":{"observed_at":"2026-08-06T22:46:37.613762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:37.677450Z","title":"Khmer natural language processing tookit","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.677450Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:dfef168cf52ad92cbdd321763ec4655c163025b760702086a5bb33fa95414acd","observation_id":"e6cfbcb3-9399-4019-bdd0-090d0eb25307","resolution":{"observed_at":"2026-08-06T22:46:37.677450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:37.821687Z","title":"spaCy: Industrial-strength Natural Language Processing in Python","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.821687Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:9752eb91c8633a4fd1126fb484a31b2e012ead4c2f5b29b2e90b134e2a295b6d","observation_id":"59ff659f-ad21-44bc-867b-0135918901f7","resolution":{"observed_at":"2026-08-06T22:46:37.821687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-07T23:54:46.322439Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-06T22:46:37.938316Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:37.938316Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:5e107012cb6eb2665c2523d97e955b066e8ed14aa8cc98745e9b0cd1bb4d8f3d","observation_id":"561fdd31-a08e-42b2-bf8f-c9cb73492142","resolution":{"observed_at":"2026-08-06T22:46:37.938316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T22:46:38.104108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.104108Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:949ab9821146cf413bf0abe6ccc821165fe4f1059e7145154b32b45bdab2166d","observation_id":"ac51f328-e38f-40e5-8db0-f5462da4da08","resolution":{"observed_at":"2026-08-06T22:46:38.104108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T22:46:38.254676Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.254676Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f1d3b9b6f1cad91d403312b1165509d9509c7184629ead575da622e84eb83b70","observation_id":"f4ff6bd0-52bb-4dfb-9c64-fbd5f186fe61","resolution":{"observed_at":"2026-08-06T22:46:38.254676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:38.411289Z","title":"The state and fate of linguistic diversity and inclusion in the NLP world","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.411289Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:af6a80b37010a39508591c669e8c6389ff956ffb3bfa73feec9f2330659ab145","observation_id":"1bff3b4a-7fb8-4da2-8b86-0d413dfd1696","resolution":{"observed_at":"2026-08-06T22:46:38.411289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-06T22:46:38.542891Z","title":"Fasttext.zip: Compressing text classification models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.542891Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:fd729e6c6532507565fd450eee891dffc7448aa06213d2daaefc9db1d8a324de","observation_id":"bf778262-2509-4a1f-8333-9248fed2b284","resolution":{"observed_at":"2026-08-06T22:46:38.542891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:38.664452Z","title":"G lot LID : Language identification for low-resource languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.664452Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:e38109915c2834c8c07c740dc01931f6bb6a584456ea43bbf30b634d38571217","observation_id":"0d33314e-4afd-42de-954f-636bcf10589b","resolution":{"observed_at":"2026-08-06T22:46:38.664452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:38.729060Z","title":"Glot CC : An open broad-coverage commoncrawl corpus and pipeline for minority languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.729060Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:479cfcf843494315de93e6c5b58193ee796b022d4b75d1cdf9fa0673f8342872","observation_id":"f91fd40f-c527-4989-b2c1-955c2585825c","resolution":{"observed_at":"2026-08-06T22:46:38.729060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06350","last_updated":"2024-11-29T04:50:35Z","snapshot_observed_at":"2026-07-06T17:42:20.597469Z","submitted_at":"2024-03-11T00:46:56Z","title":"IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06350","snapshot_observed_at":"2026-08-06T22:46:38.868060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.868060Z"},"links":{"cited_paper":"/paper/2403.06350","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:c30499d736d458793cc08e2a583b5942b6b6185dc7acdeb254c5164cabcff7fb","observation_id":"ab275403-84c5-447e-86d0-96b6802e314c","resolution":{"observed_at":"2026-08-06T22:46:38.868060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:38.953519Z","title":"Large language models only pass primary school exams in I ndonesia: A comprehensive test on I ndo MMLU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:38.953519Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:d95fd4e10a50ed01e95f18a8c40281cf68a30e42acd19400a321dc7a725fee7e","observation_id":"bf5468c1-6200-469f-b7b6-e5dccd617073","resolution":{"observed_at":"2026-08-06T22:46:38.953519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12840","last_updated":"2024-07-30T02:19:13Z","snapshot_observed_at":"2026-07-06T17:32:44.565172Z","submitted_at":"2024-02-20T09:07:41Z","title":"ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12840","snapshot_observed_at":"2026-08-06T22:46:39.027217Z","title":"Arabicmmlu: Assessing massive multitask language understanding in arabic, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.027217Z"},"links":{"cited_paper":"/paper/2402.12840","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:136198537f7db2460230c6d171e364a969a9e3e636e06abc50f1fbf03cd2dea7","observation_id":"7a77dfd9-3344-4fa0-ad00-4b36543393b8","resolution":{"observed_at":"2026-08-06T22:46:39.027217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:39.099607Z","title":"The IndicNLP Library","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.099607Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:b8bddee6cf0b52753db650ab54d7d2847dacaff7efb324fb3bfa97d457af0efc","observation_id":"96434442-1e71-403d-96da-6cea0a979b97","resolution":{"observed_at":"2026-08-06T22:46:39.099607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:39.169580Z","title":"JGLUE : J apanese general language understanding evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.169580Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f12a07aad2d9a0bec4e9250a441c4f47d8b8f14a9eac915dae3660ca7eb3d8b5","observation_id":"aecd3d84-6991-4604-9374-a45c68a30b04","resolution":{"observed_at":"2026-08-06T22:46:39.169580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16039","last_updated":"2023-08-02T00:39:25Z","snapshot_observed_at":"2026-08-04T18:29:36.809656Z","submitted_at":"2023-07-29T18:01:46Z","title":"Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16039","snapshot_observed_at":"2026-08-06T22:46:39.239094Z","title":"Rossi, and Thien Huu Nguyen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.239094Z"},"links":{"cited_paper":"/paper/2307.16039","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:515c849a707a739901f7224ac259594dd909c5aa85630bc65496147de0b539d8","observation_id":"8ee3b8ed-aa0d-41e0-91be-f4186e87631a","resolution":{"observed_at":"2026-08-06T22:46:39.239094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:39.343322Z","title":"F lau BERT : Unsupervised language model pre-training for F rench","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.343322Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:854f0e7e34484b58cb5124c57e218c039db9bc4bb0af03359c20cd8bee33ca72","observation_id":"eaeafdc2-d5d4-495e-8f1b-8115b58b28c5","resolution":{"observed_at":"2026-08-06T22:46:39.343322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:39.454235Z","title":"Open-arabic-llm-leaderboard-v1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.454235Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:a9d722ee7662af1c638047ef15f2115f9214074ad8dc7f16cf7fe9568a41ceaa","observation_id":"957c7581-a3b7-4084-a9cc-2950589ca17d","resolution":{"observed_at":"2026-08-06T22:46:39.454235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-06T22:46:39.550459Z","title":"Deduplicating training data makes language models better, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.550459Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:a4f96b59eda5826ab2128acae19a6d8cedc765ff067b7c2e8c3cf2423d8dd68d","observation_id":"98be8b18-486a-4cbf-ac8a-6ea4421f473f","resolution":{"observed_at":"2026-08-06T22:46:39.550459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:39.641312Z","title":"Kiwipiepy: Kiwi package for python, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.641312Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:83807c8c5c993e63484e7b275d5fdd1c49403c7e1c951b1d68fa0796bb05cf76","observation_id":"b6b25d1c-e7e3-4731-87d8-d9ad2d2f05ab","resolution":{"observed_at":"2026-08-06T22:46:39.641312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07475","last_updated":"2020-05-03T10:13:02Z","snapshot_observed_at":"2026-07-06T08:30:04.777443Z","submitted_at":"2019-10-16T17:05:21Z","title":"MLQA: Evaluating Cross-lingual Extractive Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07475","snapshot_observed_at":"2026-08-06T22:46:39.718750Z","title":"Mlqa: Evaluating cross-lingual extractive question answering, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.718750Z"},"links":{"cited_paper":"/paper/1910.07475","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:e6a78cb49596ab018154ba32983247c5579d6b208462b2ba7461d5d84aacd269","observation_id":"072cbc6c-d94e-493c-9e08-bb7b96b8a997","resolution":{"observed_at":"2026-08-06T22:46:39.718750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-06T22:46:39.789508Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.789508Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:025bb3d4e01466c66004e6a29c0a290ddeaacd049b36ccb25e976e3921c28e36","observation_id":"82379ae4-9e75-4a1f-b422-34a70798f7d2","resolution":{"observed_at":"2026-08-06T22:46:39.789508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-06T22:46:39.887384Z","title":"Dimakis, Yair Carmon, Achal Dave, Ludwig Schmidt, and Vaishaal Shankar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.887384Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:41c01d195796b655e3add2ee8e7958d1844abebf017abe635c9753464c7ff4f2","observation_id":"c6e28839-9292-470b-9c28-2b6c7cf4ae35","resolution":{"observed_at":"2026-08-06T22:46:39.887384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:39.950982Z","title":"Common sense beyond E nglish: Evaluating and improving multilingual language models for commonsense reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:39.950982Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:1e86f7573e8b30c6e8c62305d2fd36d1097360e89101e58697077d781290ca50","observation_id":"d4208a9a-d1bd-463b-bb92-2efd48be185b","resolution":{"observed_at":"2026-08-06T22:46:39.950982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10668","last_updated":"2022-11-10T07:01:42Z","snapshot_observed_at":"2026-07-06T12:20:43.745885Z","submitted_at":"2021-12-20T16:52:35Z","title":"Few-shot Learning with Multilingual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10668","snapshot_observed_at":"2026-08-06T22:46:40.120607Z","title":"Few-shot learning with multilingual language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.120607Z"},"links":{"cited_paper":"/paper/2112.10668","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:4478aa6f3e0ebe95959b454aef86e329bfaf7ec25762f8aa5ae8cf4bf5bf8347","observation_id":"a01ec591-bec5-493d-bd80-54c62c0db555","resolution":{"observed_at":"2026-08-06T22:46:40.120607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05640","last_updated":"2023-11-03T08:05:04Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-03T08:05:04Z","title":"FinGPT: Large Generative Models for a Small Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05640","snapshot_observed_at":"2026-08-06T22:46:40.228960Z","title":"Fingpt: Large generative models for a small language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.228960Z"},"links":{"cited_paper":"/paper/2311.05640","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:5f88820f0e09f5650210d45e4dfee5733fe1a253f0a65c9c4e0b2b598e5efdd7","observation_id":"adc5788a-159a-4393-8e78-f5702c2bec77","resolution":{"observed_at":"2026-08-06T22:46:40.228960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-06T22:46:40.311443Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.311443Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:633d0d6cd1b061ff3e79837ad0c61bf874980e9281aeefa1fa380d45262c59c5","observation_id":"ffa8195f-6c42-430e-a18d-f5c38ae41b92","resolution":{"observed_at":"2026-08-06T22:46:40.311443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:40.376511Z","title":"C amem BERT : a tasty F rench language model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.376511Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f9ab94c8f587ce2d2de1a988f8fb0071fe99f5b778db724e339b70ffdcde15fb","observation_id":"4be25e36-faac-4254-9da6-e62f2ffad73a","resolution":{"observed_at":"2026-08-06T22:46:40.376511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-06T22:46:40.446794Z","title":"Between words and characters: A brief history of open-vocabulary modeling and tokenization in nlp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.446794Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:ac80f34d71da18dd723127391d8f8db99e17145684ef7490a7291232a02aaaae","observation_id":"30ff154b-ccfc-425f-815b-7b6da12380b0","resolution":{"observed_at":"2026-08-06T22:46:40.446794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:40.530378Z","title":"Mnbvc: Massive never-ending bt vast chinese corpus","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.530378Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:53f890856a1d4c5872cc8059e0264e4e94eb725c44c18aa5f13bce57f12b3373","observation_id":"f2027824-04d2-46e6-8767-f458b66c54f0","resolution":{"observed_at":"2026-08-06T22:46:40.530378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w19-4612","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:43.575646Z","title":"Neural A rabic question answering","venue":null,"work_id":"fa753ee4-5bd4-4565-afcf-af6607e4102e","year":2019},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.612521Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:4b4733fbdd9065b130a783e4937f91cbad4d71d70d52f25772464edae875a066","observation_id":"996645bd-7901-40f4-a1f0-8f1ca508ca5d","resolution":{"observed_at":"2026-08-06T22:46:43.644012Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:40.708439Z","title":"Crosslingual generalization through multitask finetuning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.708439Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:3d90d3ba85dc3b126541ffe51bc82768af8e0233c1532648b4f8b334e193201b","observation_id":"8441a717-8366-4f55-8bd0-2c7e762cf8be","resolution":{"observed_at":"2026-08-06T22:46:40.708439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:40.789698Z","title":"Rossi, and Thien Huu Nguyen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.789698Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:d69f204fff1fe7d76a97c29d408320717221f711342859596466b53b06ef0064","observation_id":"f82ef352-d1ca-4cac-a91d-b5d765dd15d9","resolution":{"observed_at":"2026-08-06T22:46:40.789698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-06T22:46:40.884821Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.884821Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:14d5c1f8748b08557d4e8318da6e8622b10e3857404f3451bf248840c3a867ce","observation_id":"a4a84145-1fcf-45ba-930a-8d8230b3334f","resolution":{"observed_at":"2026-08-06T22:46:40.884821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:40.940992Z","title":"Omnia russica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.940992Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:65ca06bae0a3390c40067bb1bb149a9b2480fa73bab89727788194b9c2b1ec82","observation_id":"b02b7449-4b62-4a97-bf29-1576201f80f5","resolution":{"observed_at":"2026-08-06T22:46:40.940992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.003899Z","title":"Botok: State-of-the-art tokenizers for tibetan language, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.003899Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:c5c036c2357b8fe96ce295ff47d9d68d8fa653529ab18ab1d269968e6eeebfc7","observation_id":"967d7d78-2977-47f4-8d9b-6bc072bb1a8d","resolution":{"observed_at":"2026-08-06T22:46:41.003899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.104136Z","title":"Building pre-train llm dataset for the indic languages: A case study on hindi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.104136Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:29a2e6d7648d8688a07893950bf0683886478d7f36471f871783446ed2f9cef6","observation_id":"41d85cdc-552c-43ca-8bde-c85e358c797f","resolution":{"observed_at":"2026-08-06T22:46:41.104136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.162030Z","title":"Hellaswag-th, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.162030Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:a4f4c4dbf4c38e4a434892aee1238fbebc92512f00c40637e6cfb04058241f90","observation_id":"13ff38a0-299a-4cff-8429-f354bf0330b1","resolution":{"observed_at":"2026-08-06T22:46:41.162030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-06T22:46:41.208321Z","title":"The refinedweb dataset for falcon llm: Outperforming curated corpora with web data, and web data only, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.208321Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:d9e05e4f77eac483725089f7ebeb5fdcfd70e2e3d70ab69050b6b32e5c3bd5c6","observation_id":"3636b3d9-ad11-4cf7-aa9b-70f4aad44a20","resolution":{"observed_at":"2026-08-06T22:46:41.208321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.292670Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.292670Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:9b431f88a10dcdb0d6fa575ec0579e9c7b58175450911168444b2187ec7cd964","observation_id":"1421b3f6-cc9a-4d8e-9540-d4986d14c6f1","resolution":{"observed_at":"2026-08-06T22:46:41.292670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.6833407","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:43.501432Z","title":"Laonlp: Lao language natural language processing, July 2022","venue":null,"work_id":"aafcd4ef-151b-443a-bf94-27592fb1637f","year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.328021Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:0badc12084cb447718462b2c308811706392875c84b36a2fafd7e3225856fba0","observation_id":"f6c30583-bdce-4a57-86ea-01fa20c397b2","resolution":{"observed_at":"2026-08-06T22:46:43.524600Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.368981Z","title":"P y T hai NLP : T hai natural language processing in P ython, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.368981Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:5ddd0e08bd1b97becd611f7af5cbdd6f58b977f045d6f62a74ecd13fe78e3d0b","observation_id":"d4910a25-953d-42a0-a5cc-a60dfbd80149","resolution":{"observed_at":"2026-08-06T22:46:41.368981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13951","last_updated":"2023-12-21T15:38:41Z","snapshot_observed_at":"2026-07-06T17:06:37.369542Z","submitted_at":"2023-12-21T15:38:41Z","title":"Typhoon: Thai Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13951","snapshot_observed_at":"2026-08-06T22:46:41.432866Z","title":"Typhoon: Thai large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.432866Z"},"links":{"cited_paper":"/paper/2312.13951","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:306d077e4bab35d79bdcd16e6234142d08c51ccd70642ce5c7271109ff61970b","observation_id":"792e8fff-e19d-49a1-8874-bc9c2e996040","resolution":{"observed_at":"2026-08-06T22:46:41.432866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.515692Z","title":"Pllum: A family of polish large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.515692Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:f63402cb7208a11784d379dd916235a8d8c559ae1f18fb75906e2a1790dff418","observation_id":"00ab1a9a-a5b7-47ee-a3ee-117d04220b57","resolution":{"observed_at":"2026-08-06T22:46:41.515692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.584393Z","title":"Chinesesquad","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.584393Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:333f3873ba13ef7b5d733cb0627f99a8a2bc0bd39bcd31b23370b138476b307c","observation_id":"800b7eb2-19b6-4ae1-bbfa-70d87904a68d","resolution":{"observed_at":"2026-08-06T22:46:41.584393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00333","last_updated":"2020-10-26T23:23:58Z","snapshot_observed_at":"2026-07-06T09:16:51.250860Z","submitted_at":"2020-05-01T12:22:33Z","title":"XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00333","snapshot_observed_at":"2026-08-06T22:46:41.630958Z","title":"Xcopa: A multilingual dataset for causal commonsense reasoning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.630958Z"},"links":{"cited_paper":"/paper/2005.00333","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:fd9acd9d5e8ebc286b1617eb611ba9394c3f8d5b962a37b71677b0bfe538a7cd","observation_id":"8ae140c9-8575-42bd-a403-2f666001c830","resolution":{"observed_at":"2026-08-06T22:46:41.630958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.07082","last_updated":"2020-04-23T04:22:16Z","snapshot_observed_at":"2026-08-07T01:07:05.571663Z","submitted_at":"2020-03-16T09:05:53Z","title":"Stanza: A Python Natural Language Processing Toolkit for Many Human Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.07082","snapshot_observed_at":"2026-08-06T22:46:41.693007Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.693007Z"},"links":{"cited_paper":"/paper/2003.07082","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:54a0ae9a54bbf6399f55ae34fc2742a85aa96840c831310fba5c511d6ef4fdbf","observation_id":"213d288c-62ad-464c-a708-530c35a4b8d7","resolution":{"observed_at":"2026-08-06T22:46:41.693007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-06T22:46:41.766456Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.766456Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:d19ea47e83ead2c8ddde822ae70383417274660d889ade7e07ceb2fdfb7d2a93","observation_id":"16b60db9-7c02-4cb9-90ab-2fdbfc3e98e6","resolution":{"observed_at":"2026-08-06T22:46:41.766456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:41.821123Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.821123Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:5fb09adc7965c6f5ab6d6aa77f9bba819dab369abc09481d7efeb0ab985131e8","observation_id":"b23d45d5-4bb6-4328-afa5-fa2979fd8043","resolution":{"observed_at":"2026-08-06T22:46:41.821123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07206","last_updated":"2022-05-24T02:08:16Z","snapshot_observed_at":"2026-08-04T09:43:38.454504Z","submitted_at":"2022-02-15T05:43:54Z","title":"Impact of Pretraining Term Frequencies on Few-Shot Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07206","snapshot_observed_at":"2026-08-06T22:46:41.895184Z","title":"Impact of pretraining term frequencies on few-shot reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.895184Z"},"links":{"cited_paper":"/paper/2202.07206","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:64c5ca31d0495eba229f8f156c4c72d107012fc2b388032975e84ffc967a75c0","observation_id":"078640bb-dca3-4481-b332-812e91aec898","resolution":{"observed_at":"2026-08-06T22:46:41.895184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08910","last_updated":"2020-10-05T21:26:45Z","snapshot_observed_at":"2026-08-03T03:30:56.636820Z","submitted_at":"2020-02-10T18:55:58Z","title":"How Much Knowledge Can You Pack Into the Parameters of a Language Model?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08910","snapshot_observed_at":"2026-08-06T22:46:41.932613Z","title":"How much knowledge can you pack into the parameters of a language model? arXiv preprint arXiv:2002.08910, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.932613Z"},"links":{"cited_paper":"/paper/2002.08910","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:a7cdcec2d12a440826c8414984b58d68b78a1daa962b2ee60407df92de5b384b","observation_id":"f195de96-efca-4b7d-8ce1-43649ab4f262","resolution":{"observed_at":"2026-08-06T22:46:41.932613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15613","last_updated":"2021-06-01T18:17:59Z","snapshot_observed_at":"2026-07-06T10:29:01.682011Z","submitted_at":"2020-12-31T14:11:00Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15613","snapshot_observed_at":"2026-08-06T22:46:41.999731Z","title":"How good is your tokenizer? on the monolingual performance of multilingual language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:41.999731Z"},"links":{"cited_paper":"/paper/2012.15613","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:1b3e5852860a025a7786c0d388b305c09577b4b53a8a22fa4cdb02a18bf11075","observation_id":"e9647ceb-cb4a-488a-a35e-0db91dae8727","resolution":{"observed_at":"2026-08-06T22:46:41.999731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:45.885181Z","title":"Pyidaungsu: Python library for myanmar language, 2024","venue":null,"work_id":"e9cfb61b-6dd0-4cbb-be02-acd4dbade094","year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:42.080031Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:109e6fd6caca530b95835ce5d9e3decc1781e338a1fef3a333052c700d7fa06b","observation_id":"4b72f10a-e44f-434e-9e6c-32f17e657e5c","resolution":{"observed_at":"2026-08-06T22:46:45.888138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:45.850594Z","title":"Compact language detector v3","venue":null,"work_id":"e51ba4b1-5559-42c3-b386-ae5c414e9bff","year":2018},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:42.103931Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:65beceff13364fe0f62b43e128d48184cba0db785089335a81427db83477177f","observation_id":"63725564-5a04-489c-a39b-9f21105c3bc5","resolution":{"observed_at":"2026-08-06T22:46:45.879187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01613","last_updated":"2022-10-04T13:54:29Z","snapshot_observed_at":"2026-08-05T14:36:24.813251Z","submitted_at":"2022-10-04T13:54:29Z","title":"Mintaka: A Complex, Natural, and Multilingual Dataset for End-to-End Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01613","snapshot_observed_at":"2026-08-06T22:46:42.192719Z","title":"Mintaka: A complex, natural, and multilingual dataset for end-to-end question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:42.192719Z"},"links":{"cited_paper":"/paper/2210.01613","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:c8054649b5cabf27ee8dd5072399a8cf5d6f938a9b26b364165aeda42dddc264","observation_id":"8f76eddb-8eb6-4b46-a375-2dc8251a7cbd","resolution":{"observed_at":"2026-08-06T22:46:42.192719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13522","last_updated":"2025-02-24T05:37:48Z","snapshot_observed_at":"2026-08-05T16:22:48.261083Z","submitted_at":"2024-07-18T13:57:16Z","title":"INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13522","snapshot_observed_at":"2026-08-06T22:46:42.248951Z","title":"Indic qa benchmark: A multilingual benchmark to evaluate question answering capability of llms for indic languages, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:42.248951Z"},"links":{"cited_paper":"/paper/2407.13522","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:82f7ea3e002d95f1552e46171bdb912b9683e98b216962f61d10e8d5fe1b1c3e","observation_id":"6f7c332a-cbf0-48f2-8dd8-067bbe507e12","resolution":{"observed_at":"2026-08-06T22:46:42.248951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-07-06T17:23:22.706195Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-06T22:46:42.309351Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:42.309351Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:76a002e07adfbc9fbd407c2b634b6ea1dc4fb98a9993e1e18ed3ae3de40434c8","observation_id":"982ab6e6-25d6-4030-8a74-e6e7278fcfaa","resolution":{"observed_at":"2026-08-06T22:46:42.309351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:46:42.375506Z","title":"Thquad: Turkish historic question answering dataset for reading comprehension","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:42.375506Z"},"links":{"citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:0f44e90cf2db35927633ed5c8450a77e209fbc252a1f41286a6d9bb1ec997697","observation_id":"c20a06fc-aaf4-4213-a34f-b98e46657df4","resolution":{"observed_at":"2026-08-06T22:46:42.375506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":8,"verified_fuzzy":2},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 22 inbound Pith citation observations for arXiv:2506.20920."}