{"as_of":"2026-08-21T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df997a302dddc2ecbeadf8edea96c29a8fe0aab74f03d6dba7222a4f1b6f6570","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:34:24.301890Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07731/citation-record","integrity":"/paper/2506.07731/integrity","json":"/paper/2506.07731/citation-record.json","paper":"/paper/2506.07731"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:34:23.984243Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:23.984243Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:b0b31aee0c03a902e83af0d1b2a97d36f065392a6f941390ee35b0ae6b6f69ba","observation_id":"95e80969-1d94-45df-8bf0-4334f80bc952","resolution":{"observed_at":"2026-08-07T05:34:23.984243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:34:23.992896Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:23.992896Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:330cf50d22dbca48b06a243ac596192e685f45b846e11cdcfea82c82bb832195","observation_id":"91fdd820-2027-4d60-96ff-0f045e4af147","resolution":{"observed_at":"2026-08-07T05:34:23.992896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14885","last_updated":"2024-07-20T14:23:15Z","snapshot_observed_at":"2026-08-20T04:14:57.055075Z","submitted_at":"2024-07-20T14:23:15Z","title":"Falcon2-11B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14885","snapshot_observed_at":"2026-08-07T05:34:23.997962Z","title":"Falcon2-11b technical report.arXiv preprint arXiv:2407.14885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:23.997962Z"},"links":{"cited_paper":"/paper/2407.14885","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:c76c1e75578d763918c573af883d160aec88ded591de6af60e355de9ceb9b3ef","observation_id":"7951fad2-7143-48e8-a759-05cbf3e6fc03","resolution":{"observed_at":"2026-08-07T05:34:23.997962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T05:34:24.004198Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.004198Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:7f8e3c4f08183a9863fd58524740b8589af29d2314bcd6e92e249148c5720992","observation_id":"0b345c9a-2afe-4fba-8302-c587dec33ebd","resolution":{"observed_at":"2026-08-07T05:34:24.004198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T05:34:24.014052Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.014052Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:328ff5940c437dc654a00ece264d5eacff4d0367d3057d3abef7c73cfa717ba3","observation_id":"b05157fc-a886-4ca6-8c9f-3703de78beb9","resolution":{"observed_at":"2026-08-07T05:34:24.014052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.022620Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.022620Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:5b55cd93e1688dd4da6dd43726be08c076dfbdce2873818ca5afcd397ce22a23","observation_id":"f1e551fb-b465-41af-92c3-d963a481847b","resolution":{"observed_at":"2026-08-07T05:34:24.022620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.028614Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.028614Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:94028334a5ea5df1040885fdebc05a879d3826c651bc859ef8e6563f0d64679e","observation_id":"6fdd2bbe-bd98-4434-aa8f-bb9622febac3","resolution":{"observed_at":"2026-08-07T05:34:24.028614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.034078Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.034078Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:e9854347ba9a6df9d8bfc4c7e21f4e87244eb82a33c547fc5e7d3ff4ed3bc2eb","observation_id":"8d1f35d8-1ee2-4ebb-a52a-11869d87a5b0","resolution":{"observed_at":"2026-08-07T05:34:24.034078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.039242Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.039242Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:1fa473cb72d657ffa3150bb4d8cfb274a8ee915376c4b6411da3836ea767a8f8","observation_id":"6e8fa017-751c-4f4c-95c6-8e98ed6dc1ef","resolution":{"observed_at":"2026-08-07T05:34:24.039242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:34:24.045210Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.045210Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:706620010cdcddf686e30fb6ba1f3912d1e14aee17a7719ed314b5699236526d","observation_id":"344ce59a-6fd8-40d4-b415-f2f574edc337","resolution":{"observed_at":"2026-08-07T05:34:24.045210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T05:34:24.051314Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.051314Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:7404db43719a033d7d678a9eed57b000b4cd669d0fd3f8eafab0bb6fe68b390e","observation_id":"4572fc88-9d5e-4b5d-95cc-74cb531ba2ae","resolution":{"observed_at":"2026-08-07T05:34:24.051314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T05:34:24.056180Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.056180Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:a23be9c1752f99ae3425fcc8f6b40908161a1a9d77645958eb4adea777982f70","observation_id":"ffb23c3c-4554-42f2-9141-b0ec61f7c258","resolution":{"observed_at":"2026-08-07T05:34:24.056180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06857","last_updated":"2026-08-03T10:27:28Z","snapshot_observed_at":"2026-08-18T02:45:08.653847Z","submitted_at":"2024-09-10T20:45:43Z","title":"What is the Role of Small Models in the LLM Era: A Survey","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06857","snapshot_observed_at":"2026-08-07T05:34:24.061669Z","title":"What is the role of small models in the llm era: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.061669Z"},"links":{"cited_paper":"/paper/2409.06857","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:4e16d256d695b32353a75aa0c4f9c8dd5dc7eb9f75275244a59418b0f9e0e5a2","observation_id":"53bbafaf-a6e2-4903-92fa-a0c8564ca637","resolution":{"observed_at":"2026-08-07T05:34:24.061669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-16T17:16:25.053180Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-07T05:34:24.066290Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.066290Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:f133951a3945576fcd2ae7d870da081644fdf69dd3a77b5abfd71ddb221260c7","observation_id":"52abb96c-b5eb-434a-a4a2-e9fb7259ebac","resolution":{"observed_at":"2026-08-07T05:34:24.066290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-08-15T00:07:51.079800Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-07T05:34:24.071553Z","title":"Olmoe: Open mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.071553Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:963dfc70d900e0e27ba6fe7db44eb15314252885536995f095fb470638091775","observation_id":"4bfc5bee-5f46-407c-a886-a0599802c537","resolution":{"observed_at":"2026-08-07T05:34:24.071553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T05:34:24.078048Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.078048Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:2a1c7c02ae5130be575906ab3164d77ca8da592738e6ffa4dd5f65f4e2841ac0","observation_id":"eec567c6-c754-4ab4-8baa-31b7459185dc","resolution":{"observed_at":"2026-08-07T05:34:24.078048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.219630Z","title":"Liu, and Matt Gardner","venue":null,"work_id":"e3cd5e58-eb97-4955-93bb-6a21e8072a53","year":2017},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.084085Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:f5bfdde69d386dd78026f2c6eed2d154c726e5cb081f41c3b85d80ac3dd4cfc7","observation_id":"f1f48485-dae5-4d48-abad-457f907e18e4","resolution":{"observed_at":"2026-08-07T05:34:25.224858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05336","last_updated":"2025-03-13T00:09:08Z","snapshot_observed_at":"2026-08-16T12:52:12.235289Z","submitted_at":"2025-03-07T11:23:48Z","title":"Toward an Evaluation Science for Generative AI Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05336","snapshot_observed_at":"2026-08-07T05:34:24.091055Z","title":"Toward an evaluation science for generative ai systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.091055Z"},"links":{"cited_paper":"/paper/2503.05336","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:c4d2f68b4a1bdd2a30efb91ba83bce5fe3aa9c3024722bcd936cdbe0ee0b2a35","observation_id":"67010805-7da1-477f-b792-654e356efed1","resolution":{"observed_at":"2026-08-07T05:34:24.091055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-19T14:32:38.763371Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-07T05:34:24.096831Z","title":"Efficient large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.096831Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:afd4a608a5f2e173ec28f5a52024a502ef0a2d605d2f0bdfb5d6fb17d08a3f34","observation_id":"adb9d9d7-c967-4860-a65b-ae619bb15522","resolution":{"observed_at":"2026-08-07T05:34:24.096831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T05:34:24.102112Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.102112Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:b48cdad060dfcf78ecc06f99eebe464c2a1b9fd6a99e675f31028f0f895b48ad","observation_id":"3870a5ef-4ab3-4d4e-a946-e1d41744f0c6","resolution":{"observed_at":"2026-08-07T05:34:24.102112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T05:34:24.109130Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.109130Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:8adda246a5ecb49384a0fda9eafda4192553d26d45b384b637ebeb499a399a66","observation_id":"9151034a-1c74-4880-a784-ddef281cfe68","resolution":{"observed_at":"2026-08-07T05:34:24.109130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.188168Z","title":"A survey on large language models: Applications, challenges, limitations, and practical usage","venue":null,"work_id":"110555d7-4c76-499f-828e-7f766349fd70","year":2023},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.114220Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:d50ce4669191fc4c923cebf3b17a18c82efacd272554a4ca44e19cf3b8f9cf7b","observation_id":"e23300a7-7e69-4026-b516-7132558fa918","resolution":{"observed_at":"2026-08-07T05:34:25.206335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.171735Z","title":"Llm merging: Building llms efficiently through merging","venue":null,"work_id":"fc546e6e-a623-4008-abd9-94ffbd002137","year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.121140Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:246ebfc1deb410c7872037581c6f476c91201ae49751cdc4615bd75d43121b5d","observation_id":"a53c502c-186c-4836-a1b7-3b8763c440c6","resolution":{"observed_at":"2026-08-07T05:34:25.176953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.155489Z","title":"Edge-llms: Edge-device large language model competition","venue":null,"work_id":"61baa713-ef83-43ea-b3de-eb7d12a205a2","year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.127633Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:af995cf6d588cb4a68d23b6dc8961f5e922972098bd9168e2263dc0491c7dfa5","observation_id":"3e6fed67-cb35-49a5-b64d-64ef0cb9b366","resolution":{"observed_at":"2026-08-07T05:34:25.160833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.138638Z","title":"https://llm-efficiency- challenge.github.io/, 2024","venue":null,"work_id":"96703064-cf05-4d5a-8eab-bcb4f9316c83","year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.132668Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:0d484af8f63f171966db1f9ed01e7a41f1119eab9a1e562a17a87ea8dfd3b5d2","observation_id":"b96889db-bc37-443d-bd61-e9e03ada860c","resolution":{"observed_at":"2026-08-07T05:34:25.144009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.121577Z","title":"Stages and individual differences in cognitive development","venue":null,"work_id":"ac8c27cc-15b7-4415-89be-f443516f6992","year":1985},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.138720Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:f278c2be7d793e0451332422c8dcb7876a82232b5d8117d4507e6f6427641918","observation_id":"ed11da27-2811-4ce5-89ed-3a19ce82a889","resolution":{"observed_at":"2026-08-07T05:34:25.126634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.102295Z","title":"The new taxonomy of educational objectives","venue":null,"work_id":"a4060fd8-9e3c-4c45-b5e6-ddb5e5cdce83","year":2006},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.143330Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:239ddb483db48cab27535be22d88e1a606d6110701a6537dd2483c99f333268f","observation_id":"dd9d1bbc-a117-46dc-ae91-cd14e863b6ed","resolution":{"observed_at":"2026-08-07T05:34:25.108424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.085390Z","title":"Taxonomy ofeducational objectives the clas- sification ofeducational goals","venue":null,"work_id":"1705a2bf-dfcc-4588-a3c2-734f4ded9cbf","year":1964},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.148367Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:9236e9f5b419cdfcd0f669091ea11ec1f56ce9dc7bfd7c1f597e502fdfd6c71c","observation_id":"84d14a56-b06c-4121-b867-d78a700c5d94","resolution":{"observed_at":"2026-08-07T05:34:25.090701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.069256Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"ebc41b93-ff88-4494-897b-56861c5ffcff","year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.153351Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:2d050370465868a3dfaec980e444827d79c303ea9f802e46c79512f53e2d0aa7","observation_id":"54c502d6-2abc-499a-9973-f1f726de7ec0","resolution":{"observed_at":"2026-08-07T05:34:25.074261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.158211Z","title":"Fineweb-edu: the finest collection of educational content, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.158211Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:c9102bc6ef99a5ef4e86705382b8c184178fe24ac5cb5e79114d3d4923702ef1","observation_id":"43967017-ed14-46a0-ad3d-c0459a6db40e","resolution":{"observed_at":"2026-08-07T05:34:24.158211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.037113Z","title":"The stack: 3 tb of permissively licensed source code","venue":null,"work_id":"809e0ae7-6255-4731-b30c-9d127991b420","year":2022},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.162413Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:c23745250b4e415191b7a8f40cff3587716c272947849a7b3fd2944878aedd43","observation_id":"f3c32860-37fb-444a-804c-f831236b37e9","resolution":{"observed_at":"2026-08-07T05:34:25.041996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.021346Z","title":"Starcoder 2 and the stack v2: The next generation, 2024","venue":null,"work_id":"7d1cfefb-5288-4869-b032-5a4ae4fbd73d","year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.166800Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:d41a8ff49b605d7877b4e270c2f0dc48c1912a8ea267b329203b9036e1af722e","observation_id":"23d2bf85-5658-4171-845f-89efdaab09d4","resolution":{"observed_at":"2026-08-07T05:34:25.026555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:25.001361Z","title":"Infimm-webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning, 2024","venue":null,"work_id":"1d35056f-ba72-48a4-8547-b2b9a60e5265","year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.171460Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:12ece3445180d1bad3e225173083fd7c7cbd398c031c6814ede5312d705ad94a","observation_id":"d79a0753-0b9e-4eac-9394-85654265dbe5","resolution":{"observed_at":"2026-08-07T05:34:25.007656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.176655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.176655Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:9a7c23a6392290bf0905e617f1030e89f0d949dd90e387893aad963a5430deee","observation_id":"997b618d-957d-4123-a691-13e7afbd9a01","resolution":{"observed_at":"2026-08-07T05:34:24.176655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14316","last_updated":"2024-07-16T10:22:51Z","snapshot_observed_at":"2026-08-16T14:57:46.371369Z","submitted_at":"2023-09-25T17:37:20Z","title":"Physics of Language Models: Part 3.1, Knowledge Storage and Extraction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14316","snapshot_observed_at":"2026-08-07T05:34:24.181884Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.181884Z"},"links":{"cited_paper":"/paper/2309.14316","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:f0c6802a38ffa1c1c737d2dbd698d16122e8ef9ddaa62766060e718b54c00ba1","observation_id":"3da28a5b-baa0-4e81-9e21-65db149cc632","resolution":{"observed_at":"2026-08-07T05:34:24.181884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.952938Z","title":null,"venue":null,"work_id":"d11c249a-1052-4546-9ed8-fc60142536e0","year":1938},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.186580Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:c62182dce7800fe18e5a4a7e6604f9d7795a388ce51eecc463d1d721d8a0e1f3","observation_id":"a66c55f8-e0fe-4544-8742-5198e6cc34d2","resolution":{"observed_at":"2026-08-07T05:34:24.965512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.935109Z","title":"Finetasks: Finding signal in a haystack of 200+ multilingual tasks","venue":null,"work_id":"1eaba8f9-78e2-4174-a991-73d73f349bb8","year":null},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.191296Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:7b0a8bad926f86c087445fe5ffbc516aa155c0fa7d8759ae32c038b72afc7e6d","observation_id":"19f8f75e-e5fa-4486-aec8-96599f6670a7","resolution":{"observed_at":"2026-08-07T05:34:24.939950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.917902Z","title":"Codabench: Flexible, easy-to-use, and reproducible meta-benchmark platform","venue":null,"work_id":"8f949787-41af-4e45-bd4c-5c776ec636b4","year":2022},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.197272Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:e001869d495b0677c3b2c9e771a7dfa518c1ebe0c3830db030fc21acb86fe284","observation_id":"97c02f2b-3666-44f4-a5c3-9e03237df4ea","resolution":{"observed_at":"2026-08-07T05:34:24.923167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.897113Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"1fb4243d-aa59-4655-aa63-c6d2edd76c0a","year":2016},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.202089Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:cd1a8595b05ec9c1c4a665795efec63b0c053e0eb327b3714da00ffc017763c0","observation_id":"d8777a78-7700-4dc6-b742-6ad439ae53ea","resolution":{"observed_at":"2026-08-07T05:34:24.902662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.207281Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.207281Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:5e336df34c14bcabedc353c91064cca0750a6d336cdf31d1364e2548dbdabec4","observation_id":"3f422071-bfc0-44b8-8b57-3febe9296ab5","resolution":{"observed_at":"2026-08-07T05:34:24.207281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.214911Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.214911Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:9593bd50e1734d5fecbc64df3ae2de796b0b48a68f406b5b60098829e4e28575","observation_id":"cde405fe-40ec-434a-93fc-9eb8df6c4de5","resolution":{"observed_at":"2026-08-07T05:34:24.214911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.855628Z","title":"RACE: Large-scale ReAding comprehension dataset from examinations","venue":null,"work_id":"9d33bd60-864c-42cd-a986-fcf0669a6f45","year":2017},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.221983Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:bb3c2ce71d1b3e4c4f7ae6db90650fac49f788422fe0703eaf6c23a2500611d2","observation_id":"6a9663b7-dbfa-41a9-ba14-678b57f0f707","resolution":{"observed_at":"2026-08-07T05:34:24.860995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.828758Z","title":"Semantic parsing on Freebase from question-answer pairs","venue":null,"work_id":"da5a0545-9d63-49e6-b8bd-56199ccb13d1","year":2013},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.232363Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:7b312f16c460c848867bacab8b8aac24d2afc78e0ae2f2fe1dfae296ac821823","observation_id":"4dc3f492-4861-45ce-8153-8d1086f0a9b0","resolution":{"observed_at":"2026-08-07T05:34:24.834804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-08-21T02:25:44.454471Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-07T05:34:24.238587Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.238587Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:3f170a5ab3bfdc08bea9fd26c40a95c286da03c69b807558eec41dfcf86a05d0","observation_id":"63f10966-727f-4796-b79a-122ff02a3f14","resolution":{"observed_at":"2026-08-07T05:34:24.238587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.247418Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.247418Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:d204c9152b6481b39a899125f93b827a9979fa6a63ff15f28d6bd126b6c16a2f","observation_id":"54ca9199-39f0-4c6b-8df8-ae5f61b43f84","resolution":{"observed_at":"2026-08-07T05:34:24.247418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.252788Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.252788Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:986866ca74ad085ab20a5105a134dadcb1f7dba1240e94c42b47e90cbfbb13b4","observation_id":"7bff9da3-0843-4fb2-a6f5-b26d72e9d769","resolution":{"observed_at":"2026-08-07T05:34:24.252788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.785555Z","title":"Adversarial nli: A new benchmark for natural language understanding","venue":null,"work_id":"dfb6013b-6047-4d94-8cf8-f1e6236d95fe","year":2020},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.258088Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:577d1c79f80e08684198728834be43c462e43cce8a3f657ca8eb4a3a5d8d36a8","observation_id":"e4f64901-3ebc-44c7-8dfe-19f6722f4711","resolution":{"observed_at":"2026-08-07T05:34:24.793555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T05:34:24.263191Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.263191Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:e7ac41327da1193f58373bf86ed6c68e239d9fc437ab77dbcdac191e1442e6ac","observation_id":"e3940417-37d4-48e3-b1cd-6776893ee0d6","resolution":{"observed_at":"2026-08-07T05:34:24.263191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.765217Z","title":"Mask R-CNN","venue":null,"work_id":"5e126415-d4d3-49a1-8dee-2b8bc24234bb","year":2021},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.268127Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:2d2d9a1e59a78e0eb26dc8faf8894e0702cc1ba39175595bb619ad4bdc682de6","observation_id":"b6a31d19-0550-468b-a7ec-bf06c35be34f","resolution":{"observed_at":"2026-08-07T05:34:24.770431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.725830Z","title":"26 Figure 8: Validation loss across different datasets for two model variants: Scientific-DataMix (blue) and webOnly-Data (red)","venue":null,"work_id":"389e1c56-7910-4cb2-8c88-a0ea320f7dea","year":null},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.279906Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:473d04d55f320baa77a65e74b79d1526c3931841e642503d56bd75180b86863e","observation_id":"4cdcbf4b-16f7-489a-b5f5-182b4571eea9","resolution":{"observed_at":"2026-08-07T05:34:24.732017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.706405Z","title":"Lower loss on one dataset does not necessarily translate to higher capability on corresponding benchmarks","venue":null,"work_id":"21b3ecee-771e-4a79-b887-62ba5fbf3c74","year":null},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.286413Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:505921d9d62bed2015c603c554c602e6938d45c1e920af15bb1b2268d4ccaded","observation_id":"5f8a63bd-5263-46f2-97e0-305c3ee1c572","resolution":{"observed_at":"2026-08-07T05:34:24.713641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.689736Z","title":null,"venue":null,"work_id":"85c59216-dbd7-4066-a68e-2aac68397dd1","year":null},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.292490Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:81f47c88ccee3269d8d500a8082714490f84f347c204bad45dabe58fee15791f","observation_id":"b7d0f763-0cae-400e-8500-32697d552b51","resolution":{"observed_at":"2026-08-07T05:34:24.695601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.668078Z","title":null,"venue":null,"work_id":"110fe7f0-b0d8-43e8-8159-57b30da03199","year":null},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.301890Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:62397e1d9e7904b8087ec36d4a47efbcada918c7a69669c944011696c8cdb6c2","observation_id":"8169890c-602a-4ab6-a869-f4992a17611c","resolution":{"observed_at":"2026-08-07T05:34:24.676646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:24.746849Z","title":null,"venue":null,"work_id":"c92ec5c7-3918-4532-a6a3-5aa9fbd8c8fe","year":2010},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.274048Z"},"links":{"citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:a1d723baed9fc29dc25b55a02942dcd1dd26310cdb9c8e4de340516d920943d7","observation_id":"8e7be798-6258-4d8b-aba3-98392e39ca8a","resolution":{"observed_at":"2026-08-07T05:34:24.751830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T22:28:51.204346Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2506.07731."}