{"as_of":"2026-08-16T10:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1004509037d5cd309dab39e299a43bdd132705075a8b91648b1d1f3d527d08ae","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:24:48.198898Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:53:10.513788Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:47:18.036901Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14111","snapshot_observed_at":"2026-08-06T16:53:10.513788Z","title":"Essential-web v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-13T02:11:41.019930Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:10.513788Z"},"links":{"cited_paper":"/paper/2506.14111","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:a08b7b06a4723e1f2a526224ad6fa6a21fde1dc95fc975b6048697b6e65101ac","observation_id":"b59f22d2-8ee8-4b60-bd03-27d7a3f533f9","resolution":{"observed_at":"2026-08-06T16:53:10.513788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"cited_work":{"arxiv_id":"2506.14111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14111","snapshot_observed_at":"2026-07-02T17:47:18.036901Z","title":"Essential-web v1.0: 24t tokens of organized web data","venue":null,"work_id":"57f11398-5e0a-467b-9283-91b431419024","year":2025},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-14T21:44:31.429223Z"},"links":{"cited_paper":"/paper/2506.14111","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:7c12be0c48e9fc9dbcc1c0fc461a3e8bcc0dfbbadf523a7ac30c2b8d3eeeb964","observation_id":"de065f7c-c4c7-4986-92ad-bb9915218247","resolution":{"observed_at":"2026-05-14T21:48:00.985163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"cited_work":{"arxiv_id":"2506.14111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14111","snapshot_observed_at":"2026-07-02T17:47:18.036901Z","title":"Essential-web v1.0: 24t tokens of organized web data","venue":null,"work_id":"57f11398-5e0a-467b-9283-91b431419024","year":2025},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-19T16:36:30.007014Z"},"links":{"cited_paper":"/paper/2506.14111","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:49ccdae014ef208cc4912b42098a24dbb67469726f60ed53f700fb4ebb26d85d","observation_id":"61567911-6ca2-4b56-81d0-c6b9e340f525","resolution":{"observed_at":"2026-05-19T16:37:39.613418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"cited_work":{"arxiv_id":"2506.14111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14111","snapshot_observed_at":"2026-07-02T17:47:18.036901Z","title":"Essential-web v1.0: 24t tokens of organized web data","venue":null,"work_id":"57f11398-5e0a-467b-9283-91b431419024","year":2025},"citing_paper":{"arxiv_id":"2606.07778","last_updated":"2026-06-05T18:43:14Z","snapshot_observed_at":"2026-08-01T08:55:54.849134Z","submitted_at":"2026-06-05T18:43:14Z","title":"Unlocking Latent Value: Taxonomy-Guided Recovery of High-Performing Data from Low-Tier Web Corpora","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:05.238295Z"},"links":{"cited_paper":"/paper/2506.14111","citing_paper":"/paper/2606.07778"},"observation_digest":"sha256:13019167b48054cf8a10589fbf8a4732706fec4343622e27998321d99a4dedb8","observation_id":"c112aa6a-2b9d-4385-8986-d3e1b3d5df2c","resolution":{"observed_at":"2026-07-02T17:47:18.038509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14111/citation-record","integrity":"/paper/2506.14111/integrity","json":"/paper/2506.14111/citation-record.json","paper":"/paper/2506.14111"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-14T05:03:05.661970Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-07T00:24:43.006293Z","title":"Smollm2: When smol goes big -- data-centric training of a small language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.006293Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:65bf993363cf48ba33b3c3cb2f64fa4d027a8ea0af288f47611a6cf741a9dc5b","observation_id":"bbf2dd21-4b0a-4586-b119-91ade987c5e9","resolution":{"observed_at":"2026-08-07T00:24:43.006293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:52.051931Z","title":"Anderson and D.R","venue":null,"work_id":"8654ca5b-2256-4d75-a196-6faaf8b7d72a","year":2001},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.055226Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:33ec5e0f64228a115ae93b2ca5d58f4c823e3d19fd890f18ff8a055f575025f8","observation_id":"100b8b8d-5249-4afd-adc6-8ca19bfbdaa1","resolution":{"observed_at":"2026-08-07T00:24:52.165395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:51.913149Z","title":"Claude 3.5 Sonnet Model Card Addendum","venue":null,"work_id":"c65006e1-88ee-470b-b581-d1b9e29bfcad","year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.124481Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:2c60369a0fa9772e3b83231ee2a39c88ab5804c8cb06a4368917ad915e1535d2","observation_id":"0304e11a-9b12-48d8-9ca2-47d84b465fab","resolution":{"observed_at":"2026-08-07T00:24:51.988753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06666","snapshot_observed_at":"2026-08-07T00:24:43.178158Z","title":"Automatic evaluation of healthcare llms beyond question-answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.178158Z"},"links":{"cited_paper":"/paper/2502.06666","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:328b6e3149ccbbb2e6e109c26cea3443462850231fae9208cb81360ca51182a9","observation_id":"a7c90f96-cebf-48a7-badc-0e7119573cee","resolution":{"observed_at":"2026-08-07T00:24:43.178158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:24:43.221244Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.221244Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:262329a460be6ba656c9b5318b1a19de6c7c41333c930761852620e2212fd897","observation_id":"ce144191-5a91-4d8c-b132-a30c5331d179","resolution":{"observed_at":"2026-08-07T00:24:43.221244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:43.275643Z","title":"Explaining neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.275643Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:cd80c91715de4bbfc11b00cdd2da7b6a2917e92a9f4eeec882dec65d500332b0","observation_id":"e0113853-ea01-463d-bd97-002ba44d32fe","resolution":{"observed_at":"2026-08-07T00:24:43.275643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T00:24:43.342424Z","title":"Qwen technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.342424Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:5bdf1af95c4b4462d8ac5b7e827ccf2d901ee9146ba9858da46d6424787ee587","observation_id":"0c06fb48-1145-43d3-986e-afedd3866e82","resolution":{"observed_at":"2026-08-07T00:24:43.342424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04517","last_updated":"2024-12-06T15:42:07Z","snapshot_observed_at":"2026-08-13T22:31:58.054750Z","submitted_at":"2024-05-07T17:50:21Z","title":"xLSTM: Extended Long Short-Term Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04517","snapshot_observed_at":"2026-08-07T00:24:43.387036Z","title":"xlstm: Extended long short-term memory, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.387036Z"},"links":{"cited_paper":"/paper/2405.04517","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:c78bf1959da02a39edede6845b6436856b792854493345b368d8acfc21bb6d50","observation_id":"c3aae6db-5abd-4fd5-bb29-2d6556fcb4b6","resolution":{"observed_at":"2026-08-07T00:24:43.387036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:51.677607Z","title":"Elastic ChatNoir: Search Engine for the ClueWeb and the Common Crawl","venue":null,"work_id":"882dd4d5-1004-4802-9087-f501012eabf1","year":2018},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.470699Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:a1ee9b87b859f1dd7ae3294418d02ac8f9a7293c73093113277a489b6057f069","observation_id":"718c4a17-0da7-4fae-b9fb-2d67979eceb6","resolution":{"observed_at":"2026-08-07T00:24:51.814251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.04606","last_updated":"2017-06-19T17:41:07Z","snapshot_observed_at":"2026-08-14T21:48:11.385984Z","submitted_at":"2016-07-15T18:27:55Z","title":"Enriching Word Vectors with Subword Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.04606","snapshot_observed_at":"2026-08-07T00:24:43.550588Z","title":"Enriching word vectors with subword information, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.550588Z"},"links":{"cited_paper":"/paper/1607.04606","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:1bb1b5eadc290c6420879cad0910c0361395068596ce170e6cebb52a3a2fcaf8","observation_id":"b5f2efe5-d29c-4936-a061-627323149475","resolution":{"observed_at":"2026-08-07T00:24:43.550588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:43.642611Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.642611Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:b3b01e0e61b4c53bce4a818a0ee0a878e8b295ab8c0cf963f32742efb69d03fb","observation_id":"3c397d13-d3b5-4f3a-8e49-f40a1d2a2955","resolution":{"observed_at":"2026-08-07T00:24:43.642611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:51.236290Z","title":"A coefficient of agreement for nominal scales","venue":null,"work_id":"3d17a541-ab99-404e-b01e-a7527105bfe5","year":1960},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.711336Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:0b59ad8b38195683f032c23a98bb6fe03899df00c6d6f0ceb285f25103f64fdd","observation_id":"e955731b-710c-47c9-8375-f8865cbf5b17","resolution":{"observed_at":"2026-08-07T00:24:51.550152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:50.719040Z","title":"xxhash, 2025","venue":null,"work_id":"a8d29cb3-0846-40a1-bf0f-29d046b8e18d","year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.762464Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:d391a2dcd7f4dd8840cf10149dbdf530f5a9a6b58d8ba4d863b182a2c612de0d","observation_id":"c7879591-29f8-4cc8-8ec1-ce8e8a57ce03","resolution":{"observed_at":"2026-08-07T00:24:50.854441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:50.537735Z","title":"Common Crawl Corpus","venue":null,"work_id":"fce5e8ea-d0d1-4ddc-a008-86b89e1b6890","year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.859677Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:fe64451ce54ef8e7bf51be4bc9c291f30ab612b1566fdcc337f3d5c7b619a71f","observation_id":"ac98dd9b-6d7c-44e6-a93e-62a0b4a220a4","resolution":{"observed_at":"2026-08-07T00:24:50.632815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-14T04:42:19.578053Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-07T00:24:43.930026Z","title":"Deepseek-coder-v2: Breaking the barrier of closed-source models in code intelligence, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.930026Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:1a725e959f09fd0b94dc45301491aef66c06dfaad7d8fef81009e7169ceabaa6","observation_id":"fa2b8482-e5e2-485c-a0f4-d275103d34e5","resolution":{"observed_at":"2026-08-07T00:24:43.930026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T00:24:43.992953Z","title":"Deepseek llm: Scaling open-source language models with longtermism, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.992953Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:f1dc4c2c067877fdcc5f233a845a153887718a25ee8d4bf2eb815e9fc76b19da","observation_id":"267671f5-c34b-4941-aec3-a5eec864aac6","resolution":{"observed_at":"2026-08-07T00:24:43.992953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T00:24:44.037457Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.037457Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:ef35f2842d93209e6cd413a5e69a53a9b1672e2e17c09597d4865ad2feebad47","observation_id":"044fce69-09e3-4469-8434-9eb4eb4e2482","resolution":{"observed_at":"2026-08-07T00:24:44.037457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:24:44.093317Z","title":"Deepseek-v3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.093317Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:891fa1b1882817dcc5cf4d9cd27af7da23ab81336a5a21c0578f559429df7d60","observation_id":"c5a10f1d-a618-428a-9040-6f799252ce15","resolution":{"observed_at":"2026-08-07T00:24:44.093317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:50.288299Z","title":"High agreement but low kappa: I","venue":null,"work_id":"b8ccade8-64eb-4fe5-8790-1b200fbe2aaf","year":1990},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.179011Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:7d287d8fd0823262dae18202680be4ce4d23c1d3c37babb0e2259b27955ed8c7","observation_id":"41ece65a-50e1-4c22-aa42-663b5270256b","resolution":{"observed_at":"2026-08-07T00:24:50.423491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02874","last_updated":"2025-04-01T22:25:19Z","snapshot_observed_at":"2026-08-14T15:51:08.191968Z","submitted_at":"2025-04-01T22:25:19Z","title":"TheBlueScrubs-v1, a comprehensive curated medical dataset derived from the internet","version":1},"cited_work":{"arxiv_id":"2504.02874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02874","snapshot_observed_at":"2026-08-07T00:24:48.788779Z","title":"TheBlueScrubs-v1, a comprehensive curated medical dataset derived from the internet","venue":"cs.CL","work_id":"d08952f7-78c9-4049-a1e4-250f30a8c960","year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.277864Z"},"links":{"cited_paper":"/paper/2504.02874","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:06678a6e0767b0b8a94c8a16a35132cd7a7a2681142ee764bc7fb7716a0e1f1d","observation_id":"0e16b9c4-e297-40bf-9072-3d5c2d0a88fd","resolution":{"observed_at":"2026-08-07T00:24:48.866089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:44.367712Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.367712Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:47fe02f8481788fd60026a3932ad2f654f28831db32ed820601fad872df2c9cf","observation_id":"b15b8b02-9c61-4659-9b4a-62ca475ac365","resolution":{"observed_at":"2026-08-07T00:24:44.367712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T00:24:44.446581Z","title":"Gemma 2: Improving open language models at a practical size, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.446581Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:e74e69cf9127a17f67fb45d97d169bbcbc8c244397d9ef3a878321e2c8cec449","observation_id":"439a2716-54ae-423b-9fd5-97c9fd3eb242","resolution":{"observed_at":"2026-08-07T00:24:44.446581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T00:24:44.525558Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.525558Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:22440ab3576be2ab0c9a6d06bafb41a814cbc11f0273307e76c56418842b2131","observation_id":"5c051f5f-5bbb-45bc-bfe0-dbb96a14a4cb","resolution":{"observed_at":"2026-08-07T00:24:44.525558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T00:24:44.606562Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.606562Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:bbbd16f3e107b44cd22265e6501ab970151d12439b5967347f4713e482145275","observation_id":"3f7bef23-e9e6-477c-be79-31079b2d5844","resolution":{"observed_at":"2026-08-07T00:24:44.606562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:50.175324Z","title":"An empirical analysis of compute-optimal large language model training","venue":null,"work_id":"58bb18a6-2c1e-424a-aab3-6b345f7528d3","year":2022},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.646210Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:8eff4537d421cf3e637d3aa4f51454b9b216062f9e3da4a2b53c5deabf671136","observation_id":"797f30f7-3890-4b9e-aae1-bf3a1911c5fd","resolution":{"observed_at":"2026-08-07T00:24:50.249260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-12T22:05:29.529733Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-07T00:24:44.711826Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.711826Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:350689ca3c2e4128283b95ce7da9d5329a2f27784cce5a0b9acbf6773029f42c","observation_id":"dbd1821b-3b4a-41e2-a215-d4747e1e7276","resolution":{"observed_at":"2026-08-07T00:24:44.711826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T00:24:44.772548Z","title":"Qwen2.5-coder technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.772548Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:78e070c33fa8f92e2e0782ca7eb19c5a3f51c8fe3a784c8952854fff41077473","observation_id":"1282722f-9f62-4698-ac9d-8054127b5827","resolution":{"observed_at":"2026-08-07T00:24:44.772548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-15T11:16:02.015660Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-07T00:24:44.840277Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.840277Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:188799b824d7a5feb685e64e1a7ce4753d14b12a01e9db0d0f90a4a928b28d7a","observation_id":"2d50ae0d-a095-4ce6-b554-2936ebea80e4","resolution":{"observed_at":"2026-08-07T00:24:44.840277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:44.914740Z","title":"P ub M ed QA : A dataset for biomedical research question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.914740Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:470988e67c6caa833994e3d20c2469691befdcbbd1bff8729f5025cfae1129f7","observation_id":"81d83b3a-94ec-4440-8d7c-869e7b07ecf1","resolution":{"observed_at":"2026-08-07T00:24:44.914740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T00:24:44.983417Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:44.983417Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:77cf169f8115a3854eccc46c5ee72405d511298f92b37b2e17317c3a7060e1ea","observation_id":"6e9af4b8-08da-4d8f-a2b2-49db18876267","resolution":{"observed_at":"2026-08-07T00:24:44.983417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:49.989019Z","title":"Justification for the use of cohen’s kappa statistic in experimental studies of nlp and text mining","venue":null,"work_id":"284f79c8-137d-4085-bd95-c2d38bf9374e","year":2022},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.066602Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:df49760765b3851f30986fa36712c27dfd61967e91725728717d9b25954010ce","observation_id":"ed56feea-08d0-4809-8bb9-d413e49cc7eb","resolution":{"observed_at":"2026-08-07T00:24:50.093890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-07T00:24:45.137228Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.137228Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:56f035349e13a5ed4048628ee3d3a342d5b04d7772770edb3e024a1ddbbf4377","observation_id":"26fdf691-eea6-45f1-bb95-bfb22480a147","resolution":{"observed_at":"2026-08-07T00:24:45.137228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-07T00:24:45.200550Z","title":"Dimakis, Yair Carmon, Achal Dave, Ludwig Schmidt, and Vaishaal Shankar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.200550Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:098eae12da7a7d5cc5421f25f68d2dfdf5f70279c4885fdbe738d40b62c22eee","observation_id":"ea194d4d-5674-42a4-ab5e-0c461ca7daa8","resolution":{"observed_at":"2026-08-07T00:24:45.200550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-07T00:24:45.298601Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.298601Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:faccf0b95ef8a74f8c60dbeb8bd71e0f455b3248f3c98283150ee5a5da3316f1","observation_id":"4bba9f21-7284-434e-9af4-2ed79294735c","resolution":{"observed_at":"2026-08-07T00:24:45.298601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-07T00:24:45.367967Z","title":"Muon is scalable for llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.367967Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:57fb6beac38abc7d55726128a4dfe2e7a989877487c3130ba901cbd722235827","observation_id":"c336aaab-3116-4376-a2dd-2f3984afcc3c","resolution":{"observed_at":"2026-08-07T00:24:45.367967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:24:45.457924Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.457924Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:4e292cf43197cc15e63c2d40befb2db877a7c1e6ed8df46b12a6e8bd98944b50","observation_id":"4a4890a0-09f6-49b7-94a3-a9d56b7e99c9","resolution":{"observed_at":"2026-08-07T00:24:45.457924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-07T00:24:45.515723Z","title":"Starcoder 2 and the stack v2: The next generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.515723Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:7d4aaa6744a9f6418eaaa53389a70eef133cd0f0c2aff09f09a12f01b713a8be","observation_id":"e1a0941e-1a6c-4ef3-a8a8-079e0ab8685c","resolution":{"observed_at":"2026-08-07T00:24:45.515723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:49.809840Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation, April 2025","venue":null,"work_id":"c7fc688f-bb74-41e8-9dbc-2ace7193e76f","year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.603174Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:b672c5ef73326fa74da311b40baf7c92e14373d7f6be1b92d5ce04b06b969649","observation_id":"131b6195-9ff3-4cff-b826-02ec42827a6c","resolution":{"observed_at":"2026-08-07T00:24:49.896515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:49.639824Z","title":"Free decimal correspondence","venue":null,"work_id":"bea2d32a-2e46-4162-b23c-24e98477100b","year":2010},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.680665Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:0d9648eabcce91b12d0fe132509d70eab9ef584786e1c94660f1952ec687e82a","observation_id":"359e2ad5-0a17-4b4c-af23-d4307bbce1c3","resolution":{"observed_at":"2026-08-07T00:24:49.715675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T00:24:45.785249Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.785249Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:c7d4b7c3a820bb9704b2dc255cdce54d098985481119723e270f6b9cef93e174","observation_id":"06a33f81-1812-42bb-b6c6-e0669b644d1a","resolution":{"observed_at":"2026-08-07T00:24:45.785249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:49.408170Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":"49ce9519-ee20-434e-b037-7c8357c75845","year":2022},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.876198Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:2babff9aaca714ea7cf4be7161a4549b9623c634765f0c91febeacb941505c95","observation_id":"5f4ed0ec-cedb-4ec8-8fd7-58c69a908c1f","resolution":{"observed_at":"2026-08-07T00:24:49.519484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06786","last_updated":"2023-10-10T16:57:28Z","snapshot_observed_at":"2026-08-15T13:45:34.900381Z","submitted_at":"2023-10-10T16:57:28Z","title":"OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06786","snapshot_observed_at":"2026-08-07T00:24:45.960470Z","title":"Openwebmath: An open dataset of high-quality mathematical web text, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:45.960470Z"},"links":{"cited_paper":"/paper/2310.06786","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:234f8bf1a2d595338f57979b3a5f81ada773c1e588871f5da828b80e17941e81","observation_id":"f87005dc-6eb3-4ebb-afb3-da8c7a41f397","resolution":{"observed_at":"2026-08-07T00:24:45.960470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-07T00:24:46.051496Z","title":"The refinedweb dataset for falcon llm: Outperforming curated corpora with web data, and web data only, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.051496Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:0535a814800162b9f000f39f4d6bc01c2be7cbe695acbbc2d6640122a0cae9ec","observation_id":"54d6ee3a-6923-44f3-8827-93f7210d173f","resolution":{"observed_at":"2026-08-07T00:24:46.051496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-07T00:24:46.139204Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.139204Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:de1261ec5cfca351a2ce8da0deedcd1ea7c579b3e487138e0174a3dccfa96b04","observation_id":"294e34f8-21fb-4e8b-a910-a33a5e1cf8ec","resolution":{"observed_at":"2026-08-07T00:24:46.139204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:24:46.256147Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.256147Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:0ee9a97a1dd422300cf59fdd5b02c708667acaa36a3eafeaabeca8c502c3c33d","observation_id":"6ab124d1-bf08-4cfd-86df-b79c62c7391b","resolution":{"observed_at":"2026-08-07T00:24:46.256147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T00:24:46.321986Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.321986Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:9651c70ad94a2cc6ac02f6809abfaa3f1d31734bebb6795b72fd0e1b3a09bf7c","observation_id":"5d787ecb-c707-45ea-88bd-932666f6a5e4","resolution":{"observed_at":"2026-08-07T00:24:46.321986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-08-14T16:16:21.567225Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-07T00:24:46.408244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.408244Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:708c6e2fc5c4f472c9104f98f35a4e8760ec01acfd71d0cefeaedf75ea6148b9","observation_id":"6b31c8fe-451c-4326-8d09-134789be9dca","resolution":{"observed_at":"2026-08-07T00:24:46.408244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:24:46.478337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.478337Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:23bd0a57a2ab3a4ebf6c9da03d0c255426c48177a2dcf07b766ce3a725845abc","observation_id":"0a8c05d0-1f69-4bcd-a7d6-d907d4d4c393","resolution":{"observed_at":"2026-08-07T00:24:46.478337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16690","last_updated":"2024-06-24T14:51:31Z","snapshot_observed_at":"2026-08-12T23:36:03.305357Z","submitted_at":"2024-06-24T14:51:31Z","title":"Scaling Laws for Linear Complexity Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16690","snapshot_observed_at":"2026-08-07T00:24:46.594918Z","title":"Scaling laws for linear complexity language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.594918Z"},"links":{"cited_paper":"/paper/2406.16690","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:dcf33e7718efaa507ec752a683396fce023cf3266baa9cf681b9380df091191d","observation_id":"084effe9-d473-4cb3-a801-0e8d4de400f8","resolution":{"observed_at":"2026-08-07T00:24:46.594918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-13T10:09:46.005593Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-07T00:24:46.687157Z","title":"Slimpajama-dc: Understanding data combinations for llm training, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.687157Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:7a84aed6b84fdd376b5391333e4fc559183db152ea601e13646f4ea663a5a403","observation_id":"5099288e-15c6-4d6f-bd18-e7e5be192c45","resolution":{"observed_at":"2026-08-07T00:24:46.687157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13138","last_updated":"2022-12-26T14:28:24Z","snapshot_observed_at":"2026-08-13T13:14:16.345541Z","submitted_at":"2022-12-26T14:28:24Z","title":"Large Language Models Encode Clinical Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13138","snapshot_observed_at":"2026-08-07T00:24:46.754327Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.754327Z"},"links":{"cited_paper":"/paper/2212.13138","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:2c9888d2e36d6541bd86b73139fd6a45d9a85e08763fdb932cd7f2d64a888493","observation_id":"76463205-ba45-4647-a386-41f30e0d104f","resolution":{"observed_at":"2026-08-07T00:24:46.754327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-13T14:15:52.124827Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-07T00:24:46.861099Z","title":"Learning by distilling context, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.861099Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:4e386844ff8db9aba51afe8363621ddb4e2b94c8c3f3d618991492daa12fd32b","observation_id":"c544393c-4aa6-4ab5-8fa6-30f90d333d8f","resolution":{"observed_at":"2026-08-07T00:24:46.861099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:49.235275Z","title":"Software Heritage Archive","venue":null,"work_id":"98b38aa6-fd35-4411-a561-fa300632f96c","year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:46.973042Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:edd730140b891fdd5ba0cfbff9dd020b407f0844ad69334d94534c87825f852d","observation_id":"6aa47a73-a0c7-4c9b-a029-3e582cb994f0","resolution":{"observed_at":"2026-08-07T00:24:49.307263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-13T04:29:45.563095Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-07T00:24:47.084966Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.084966Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:a415d4370f69c4aff09ef353b132390ff35a07ed59d2eb2ed502415a5328f884","observation_id":"6382c562-ed64-4f3f-acb5-e08a3756855a","resolution":{"observed_at":"2026-08-07T00:24:47.084966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14486","last_updated":"2023-04-21T20:14:07Z","snapshot_observed_at":"2026-08-13T15:14:20.983519Z","submitted_at":"2022-06-29T09:20:47Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14486","snapshot_observed_at":"2026-08-07T00:24:47.187123Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.187123Z"},"links":{"cited_paper":"/paper/2206.14486","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:41a1f6915d865b02606584f9eda82ba3dd6565037bed4c2dd5fdb88a98926831","observation_id":"061e9dd0-0aba-4d73-9ffc-af81e7a6bfa7","resolution":{"observed_at":"2026-08-07T00:24:47.187123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-11T23:14:36.681577Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-07T00:24:47.275435Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.275435Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:376171ac89915a69073c9ca91b373be4284f6e4a7e74638ad19c42a456583fd6","observation_id":"a1984adb-b1b0-4143-ad67-f8f9b40d8baf","resolution":{"observed_at":"2026-08-07T00:24:47.275435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:47.353848Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.353848Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:469ae3e69aeb94738d649663aa9d03b2d4338e1579cbf9651f294634198647bd","observation_id":"4e579390-17ea-4029-8e6c-467cd69e76a6","resolution":{"observed_at":"2026-08-07T00:24:47.353848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T00:24:47.408996Z","title":"Llama: Open and efficient foundation language models, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.408996Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:9675e5e7cddb025d19724f7290214b26942a2d58b8caed7d5dabd08c2d16866b","observation_id":"d44c38ab-e9a2-4485-83e7-1143a21dab3f","resolution":{"observed_at":"2026-08-07T00:24:47.408996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T00:24:47.514364Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.514364Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:802a81cbe3ff476cee49dab53dbad8f7a6750a7364a1cc986af9f681755e3572","observation_id":"7247ad2b-7992-444f-9143-a3009ee0f4f8","resolution":{"observed_at":"2026-08-07T00:24:47.514364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-14T07:55:53.745138Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T00:24:47.623955Z","title":"Redpajama: an open dataset for training large language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.623955Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:7409e408054f4ab3bbdd40bb0a9311d91ac644ac68d9f581101109e097d22acb","observation_id":"566ef656-7006-4020-8388-65edc1ea2007","resolution":{"observed_at":"2026-08-07T00:24:47.623955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:49.037139Z","title":null,"venue":null,"work_id":"09200e15-31c5-433a-b61a-a3b89bf17c64","year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.731636Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:ba93729f857ca6366116582b7533183a162d7b49b993a2881aa873e572ff2157","observation_id":"db3495fa-d306-426e-9e90-ce76ab3d000c","resolution":{"observed_at":"2026-08-07T00:24:49.137217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-14T15:17:42.222016Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-07T00:24:47.820795Z","title":"Organize the web: Constructing domains enhances pre-training data curation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.820795Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:20db71ab14e5d19ec1fde3a7f6700c2cfe9d79674c0059f8fce516e05d774782","observation_id":"cf8fc6f8-8a3c-484f-8854-57fe1a5ae6f2","resolution":{"observed_at":"2026-08-07T00:24:47.820795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T00:24:47.906805Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.906805Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:4281f1d36a2e4bf1b40e657f193d99b822562248b8b52a342a7451e74d87c548","observation_id":"47f16f26-2e29-4f7d-982d-e94feabce806","resolution":{"observed_at":"2026-08-07T00:24:47.906805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T00:24:47.991917Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.991917Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:20e83bbf78a0ba1e91196d22637de84aaad41a05d49d8d5d13c691f0023b28b0","observation_id":"2f58b06b-4f34-48a7-89a6-3dcc25383bf6","resolution":{"observed_at":"2026-08-07T00:24:47.991917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:48.039500Z","title":"Naturalreasoning: Reasoning in the wild with 2.8m challenging questions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:48.039500Z"},"links":{"citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:ab9ffe5f05efcff1d5ed467e9fa9f02b100f3021f93a1dd65413dfda628398a8","observation_id":"17a9b6b6-ba5a-4006-be0a-dcdb6961f148","resolution":{"observed_at":"2026-08-07T00:24:48.039500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T00:24:48.118608Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:48.118608Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:86796039c650d55aa15f12445887bcb7fad5450ecedba192d2f361a7761214d0","observation_id":"95b395fa-743b-45ff-bae5-59e228e34505","resolution":{"observed_at":"2026-08-07T00:24:48.118608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02807","last_updated":"2025-04-03T17:52:07Z","snapshot_observed_at":"2026-08-07T16:10:45.135810Z","submitted_at":"2025-04-03T17:52:07Z","title":"MegaMath: Pushing the Limits of Open Math Corpora","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02807","snapshot_observed_at":"2026-08-07T00:24:48.198898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:48.198898Z"},"links":{"cited_paper":"/paper/2504.02807","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:fb17a886bbc1ba9ed2c7dbf5724b78de93a4f26f899909891db7c8d23d7dd68d","observation_id":"5bd8c1fb-4044-4c16-ad19-8d19fcb7255b","resolution":{"observed_at":"2026-08-07T00:24:48.198898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 4 inbound Pith citation observations for arXiv:2506.14111."}