{"as_of":"2026-08-11T12:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:661bdf3330f8deb5e5d784a6e477dfe5e57978aee661cf6d881b3efb24fd0343","coverage":[{"denominator":135,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:17:55.889322Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:44:04.984553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T22:42:47.026295Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17743","snapshot_observed_at":"2026-08-06T11:44:04.984553Z","title":"Yulan-mini: An open data-efficient language model, dec 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-09T19:06:02.138099Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.984553Z"},"links":{"cited_paper":"/paper/2412.17743","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:ce57df48b5590545e49f3e3a88bb3778bfa1f701c0ee760d79a3cc50397ae3cc","observation_id":"0f838f95-5254-4696-9768-1be08b293133","resolution":{"observed_at":"2026-08-06T11:44:04.984553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"cited_work":{"arxiv_id":"2412.17743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17743","snapshot_observed_at":"2026-06-28T22:42:47.026295Z","title":"X., and Wen, J","venue":null,"work_id":"e44fffcf-c836-45bd-bbd5-e8b61f36e825","year":null},"citing_paper":{"arxiv_id":"2605.31175","last_updated":"2026-05-29T11:42:55Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T11:42:55Z","title":"Towards Efficient LLMs Annealing with Principled Sample Selection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:36:28.889515Z"},"links":{"cited_paper":"/paper/2412.17743","citing_paper":"/paper/2605.31175"},"observation_digest":"sha256:e9044092aade0f42563e0b4204647ad6f86bbe8892f4addae9434b971ac39e4d","observation_id":"bdd60ec4-fc6d-4569-bebe-949dfecc6068","resolution":{"observed_at":"2026-06-28T22:42:47.027667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17743/citation-record","integrity":"/paper/2412.17743/integrity","json":"/paper/2412.17743/citation-record.json","paper":"/paper/2412.17743"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.471132Z","title":"Synthetically generated reasoning dataset (gsm8k-inspired) with enhanced diversity using gretel navigator and meta-llama/meta-llama-3.1-405b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.471132Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:cf3a2adbfd6c30073334c42bb50d87a3dba593a4be5d89d4dbc844b5b6960361","observation_id":"df77c6d9-4f40-4203-bedf-43a1607a9ad6","resolution":{"observed_at":"2026-08-11T05:17:55.471132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.476338Z","title":"GQA: training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.476338Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:d9e8cae4b446baa386d750ad0170f786fa36c4b32b9d030a14d3726d564c6fd0","observation_id":"f4218e80-733e-4b6f-b694-44c605f6f83e","resolution":{"observed_at":"2026-08-11T05:17:55.476338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.481319Z","title":"Smollm2 - with great data, comes great performance, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.481319Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:3f3147f4bdcfd367e35ca61bd0cf82281be358ccb1873c4582686ac621e3a18e","observation_id":"47c0352e-4240-465a-ad63-c8eb4b1d05d6","resolution":{"observed_at":"2026-08-11T05:17:55.481319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-11T05:17:55.485739Z","title":"Nye, Maarten Bosma, Henryk Michalewski, David Dohan, Ellen Jiang, Carrie J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.485739Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:babdd37c3d1a56478d29acdcc2cb11540be515f2e75443ab863ab60c7cc6dffa","observation_id":"e37bebbe-739c-44fd-9835-bf0361a23c9a","resolution":{"observed_at":"2026-08-11T05:17:55.485739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.489943Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.489943Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:adff0d704c0365e7b01d57b6668df542f78a3abc38b6222a8a02a76dafd2ebf1","observation_id":"3c185ad2-d8ba-4e5a-8194-27ed0d1b079e","resolution":{"observed_at":"2026-08-11T05:17:55.489943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T05:17:55.493672Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.493672Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:87ada9fad9d74d9fca56adecb6c21b7cbc287396eb36a39542de0998a5e001c4","observation_id":"e94615bc-fb03-40db-b562-11ac0fae0d5d","resolution":{"observed_at":"2026-08-11T05:17:55.493672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.498666Z","title":"Numinamath 7b cot, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.498666Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b7ccf06005f17d9b5ef8f6606687165601528d7e83f8b4221416c845c98a8284","observation_id":"0e699dc9-a885-4867-ac49-624da63de074","resolution":{"observed_at":"2026-08-11T05:17:55.498666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-07-06T17:36:27.931373Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-11T05:17:55.502568Z","title":"Stable LM 2 1.6b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.502568Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:00d215185d5d9d4498c6a279cb0e2ce5b74ebf4262404aa714c3e4438817c5a6","observation_id":"272b80f4-77c6-4adf-a15c-c943b17e1b84","resolution":{"observed_at":"2026-08-11T05:17:55.502568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-11T05:17:55.507213Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.507213Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6e7ec4110f7b12c36ea906af1c158e4b3a907920d23ab1a9da8853d43188f14d","observation_id":"fbf056b8-538a-4826-b382-f64b47e8f88c","resolution":{"observed_at":"2026-08-11T05:17:55.507213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.511890Z","title":"Enriching word vectors with subword information","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.511890Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:4e4e6fa3ca7c93d22d0b29aa94a2390db7530e7fee46373f32c408c9cd2d74af","observation_id":"95f3bacb-3738-4743-8d1c-e8fc6ca2ccde","resolution":{"observed_at":"2026-08-11T05:17:55.511890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T05:17:55.515998Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.515998Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:00799d6224f8bb19c2af6d3d7c7d23aa34a22d774ede51333725ac1f4d6b9b4b","observation_id":"02e4b734-3974-4cec-a258-a447529ed422","resolution":{"observed_at":"2026-08-11T05:17:55.515998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18743","last_updated":"2024-07-26T13:55:21Z","snapshot_observed_at":"2026-08-11T00:36:17.121059Z","submitted_at":"2024-07-26T13:55:21Z","title":"Towards Effective and Efficient Continual Pre-training of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18743","snapshot_observed_at":"2026-08-11T05:17:55.520414Z","title":"Towards effective and efficient continual pre-training of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.520414Z"},"links":{"cited_paper":"/paper/2407.18743","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:89acc3be644aec4bff4886bc40738eefcfffef998d3959e30ccc241c79a7a8ff","observation_id":"9872fc41-c8f6-4414-b6d4-029bdfe30fa2","resolution":{"observed_at":"2026-08-11T05:17:55.520414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T05:17:55.524982Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.524982Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:8adbbea11b7ae3ac051ed54bdf05f0ddf790e136e65396dbe43e29acd74b5a5d","observation_id":"b69e5e27-df9c-4063-ac7d-257c56c29113","resolution":{"observed_at":"2026-08-11T05:17:55.524982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-11T05:17:55.529338Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.529338Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:8cdcf8b6556087c6388dbfeefd160ef8e9a2e3c244611a016ec146d77e0a841f","observation_id":"e5f94ab0-63e4-4d26-aeb0-e904cbdb294f","resolution":{"observed_at":"2026-08-11T05:17:55.529338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.533625Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.533625Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:da6c595c481ceea3bbaccf96f068d7936571dec1634824642f2d875ab814bcb4","observation_id":"ed4ff887-4d77-4b69-b3f9-260798e02840","resolution":{"observed_at":"2026-08-11T05:17:55.533625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.537912Z","title":"Stable language model pre-training by reducing embedding variability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.537912Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2d597dc4272dcedf678c5008f13e2a4b6be6c984ae464d1fcb83d6313fbb89ca","observation_id":"cb83bf82-f089-408a-ae44-9bd1c40c0646","resolution":{"observed_at":"2026-08-11T05:17:55.537912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T05:17:55.542009Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.542009Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0f2cad16cbf5dbfdb501ef50cd8a285dbff91f73731adaa869cd414e204bc5f3","observation_id":"da012ea5-0bc2-42ae-97f6-7f9ba1d720ed","resolution":{"observed_at":"2026-08-11T05:17:55.542009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.546543Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.546543Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:152ddd3b5eb602282657ffe0e70c92db6c08a56f1c78089ddc8db846eb0e8d74","observation_id":"22b90065-8b4c-4236-b9db-83e8981b7c1d","resolution":{"observed_at":"2026-08-11T05:17:55.546543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.550757Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.550757Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:15b4ed3d3a2efd3807676b560a58363835a76ef1e7037084b4c3d40ac1858563","observation_id":"fba000f4-a138-4d21-aa15-c521de1ca8e9","resolution":{"observed_at":"2026-08-11T05:17:55.550757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.554907Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\' e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.554907Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:9cf460f1972bd88a3c1db315fe257a6412718cbeab6d6dda5a4b7b2e158d58be","observation_id":"bbf71baf-c53e-483b-8904-4493fbe45e2e","resolution":{"observed_at":"2026-08-11T05:17:55.554907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.08859","last_updated":"2016-05-27T15:17:34Z","snapshot_observed_at":"2026-07-06T04:54:36.252884Z","submitted_at":"2016-04-29T14:53:00Z","title":"The Z-loss: a shift and scale invariant classification loss belonging to the Spherical Family","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.08859","snapshot_observed_at":"2026-08-11T05:17:55.558844Z","title":"The z-loss: a shift and scale invariant classification loss belonging to the spherical family","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.558844Z"},"links":{"cited_paper":"/paper/1604.08859","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6b349d722d67901ce4fe73cd7cc4654fec0b3e3e8035ce58ce7f2ecf1f881e6b","observation_id":"30bc93ab-dd92-45a3-970a-41c9f2d2daae","resolution":{"observed_at":"2026-08-11T05:17:55.558844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T05:17:55.563036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.563036Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:12224d9b27bb69dd7f9f58f8b928b9630f64d500e88659f9a5ee871e664bb002","observation_id":"bc5c1223-b083-41f4-94d7-3c48f1089703","resolution":{"observed_at":"2026-08-11T05:17:55.563036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-07-06T15:13:02.077291Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-11T05:17:55.567673Z","title":"Cerebras-gpt: Open compute-optimal language models trained on the cerebras wafer-scale cluster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.567673Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e0614fcafc0ff7872f288cd92903dddad6361240f6be9775b3c00717c54869fa","observation_id":"af3b0201-dff7-427d-b99f-80d6287253a9","resolution":{"observed_at":"2026-08-11T05:17:55.567673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-07-06T15:13:02.077291Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-11T05:17:55.572114Z","title":"Cerebras- GPT : Open Compute - Optimal Language Models Trained on the Cerebras Wafer - Scale Cluster , April 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.572114Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:c64eafa1c662b6bd805298a1a622cace89234af4b74f7d7d72b732eba4179fc5","observation_id":"ccd84ed2-68ac-41d0-8c31-aacf436a642b","resolution":{"observed_at":"2026-08-11T05:17:55.572114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.576433Z","title":"Fewer truncations improve language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.576433Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b3f731b1c0ec6897d9d42190c744f0e2709cb9429ca25f315262824dff7bffd9","observation_id":"36df1169-9b02-4f39-bcb4-79dc5fccd27e","resolution":{"observed_at":"2026-08-11T05:17:55.576433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18693","last_updated":"2025-05-27T11:56:56Z","snapshot_observed_at":"2026-08-11T07:30:38.067034Z","submitted_at":"2024-10-24T12:42:04Z","title":"Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18693","snapshot_observed_at":"2026-08-11T05:17:55.581180Z","title":"Unleashing Reasoning Capability of LLMs via Scalable Question Synthesis from Scratch , October 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.581180Z"},"links":{"cited_paper":"/paper/2410.18693","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:3317697afc4a9697217d0ac6083956f1f1e805ee230a3a08d900fedba5c95825","observation_id":"22e330f8-59c7-45d4-86a3-afa5ed5e212f","resolution":{"observed_at":"2026-08-11T05:17:55.581180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T05:17:55.585075Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.585075Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:85681b6191ff429f80bab62473c90b1040bf87774c2c46815b5abdcc39467a8c","observation_id":"03f5878e-5136-4877-9845-24c75587f9f5","resolution":{"observed_at":"2026-08-11T05:17:55.585075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.589435Z","title":"How to train long-context language models (effectively)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.589435Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:fff8f34ca233c10814b0d70efe9a50f2a107ff27bca604003d7fcb8229777e38","observation_id":"b9452567-fcfc-43d5-b05b-1ed6feac7507","resolution":{"observed_at":"2026-08-11T05:17:55.589435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.593442Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.593442Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e2a6fa9c30f0e9f38f18e3acab9f2d63963c34fcb3e7fb92a5d532712eeb7fe9","observation_id":"9a6e0d48-8c4e-4080-af5c-01b40a15c30b","resolution":{"observed_at":"2026-08-11T05:17:55.593442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-11T05:17:55.597466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.597466Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a82972f60d37efbf15817b3bba02aed8a00a371d0cd60c55b4fb269c43a89490","observation_id":"f1605bc3-5fd9-4b9b-b773-7caf82493577","resolution":{"observed_at":"2026-08-11T05:17:55.597466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-11T05:17:55.601448Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.601448Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b7fb61568248195829661e5f7afad8ef6f561330f23cee6030ee828cb39b0eee","observation_id":"6a403ff7-89b4-4607-92e6-f7666643267d","resolution":{"observed_at":"2026-08-11T05:17:55.601448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12568","last_updated":"2024-09-19T08:41:21Z","snapshot_observed_at":"2026-08-07T18:13:29.792721Z","submitted_at":"2024-09-19T08:41:21Z","title":"InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12568","snapshot_observed_at":"2026-08-11T05:17:55.605726Z","title":"Infimm-webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.605726Z"},"links":{"cited_paper":"/paper/2409.12568","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6c03e92251c74b3c2eba8293cbec275aaf6889a0a6d9504e89f9f69e08eba33c","observation_id":"2ddbd7f9-26bc-4f36-ac4f-33c67402dd97","resolution":{"observed_at":"2026-08-11T05:17:55.605726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-07-06T16:08:33.160103Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-08-11T05:17:55.610187Z","title":"Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.610187Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e95ebc78f147f134e44ccdc5944e829cbb11ea5040a2f11fe5f333d05f60d62c","observation_id":"63e25bf4-9410-445f-8098-cb5f101cb6e8","resolution":{"observed_at":"2026-08-11T05:17:55.610187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.615373Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.615373Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:14c20bffa037a9abd047983a2b9bb7b6c1c9cdb6ab7cd52866856fd096bf8be0","observation_id":"f3b6e776-e0ee-41e8-bbe1-24af0c471084","resolution":{"observed_at":"2026-08-11T05:17:55.615373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.619133Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.619133Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7870c185f2e8dd4711c3bd1cc6b0a626c42d0ea9b2b5ab16de10ce6655376f8e","observation_id":"0f9d24a7-59ad-4173-a868-dccd6a75ca9a","resolution":{"observed_at":"2026-08-11T05:17:55.619133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-11T05:17:55.622904Z","title":"RULER: what's the real context size of your long-context language models? CoRR, abs/2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.622904Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:eab1ab598ac888fb62175e96cb634769de1fed76d6d4d853254abdbb959d23c1","observation_id":"3c4af250-12f0-4265-a334-039538d6197e","resolution":{"observed_at":"2026-08-11T05:17:55.622904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-08-10T10:23:31.465008Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-11T05:17:55.627059Z","title":"Liger kernel: Efficient triton kernels for LLM training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.627059Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:4ff4eaad191e0af24781ed530ad08eca0edb4cb6cce702f525a6591b3bd96d3f","observation_id":"4e44f159-f1be-4f96-95af-8b6c3daa637e","resolution":{"observed_at":"2026-08-11T05:17:55.627059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T05:17:55.631254Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.631254Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b8c26e64594438d263ff288a53c49f1f90673c68405e05e42b84ce5d31a2ce57","observation_id":"543551f6-61da-48a3-9c78-d6bea96bef33","resolution":{"observed_at":"2026-08-11T05:17:55.631254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.635377Z","title":"Towards reasoning in large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.635377Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:ab81e28f4ae1eaf4136c6c8cca335e6950dd43d4ab250b3f63066717bd828ea9","observation_id":"af6f29f5-c0f0-4490-bdc5-37df4a1b3eae","resolution":{"observed_at":"2026-08-11T05:17:55.635377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-11T08:46:04.544195Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-11T05:17:55.639091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.639091Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:f4955a2819fca6943d23ee517d17366c81e9dab67362cea838721d918c788d09","observation_id":"fd4a7a7c-209e-4ac8-8610-9380619344df","resolution":{"observed_at":"2026-08-11T05:17:55.639091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.643976Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.643976Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:88a98671d569cb3825493678c7938208c40df2846423811cff6097606e269f8d","observation_id":"7b105f39-5c3a-44cd-87fe-c318ad56a07d","resolution":{"observed_at":"2026-08-11T05:17:55.643976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11694","last_updated":"2024-12-31T01:38:12Z","snapshot_observed_at":"2026-08-09T03:55:09.041328Z","submitted_at":"2024-11-18T16:15:17Z","title":"Enhancing LLM Reasoning with Reward-guided Tree Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11694","snapshot_observed_at":"2026-08-11T05:17:55.648063Z","title":"Technical report: Enhancing llm reasoning with reward-guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.648063Z"},"links":{"cited_paper":"/paper/2411.11694","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:19801c7bbde2715258a85279518f1d5e44e35dbf7feffdabd1deb586157503cc","observation_id":"240854d5-6f3e-4d93-b7b2-5728c82054bd","resolution":{"observed_at":"2026-08-11T05:17:55.648063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-10T14:27:02.964369Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-11T05:17:55.652243Z","title":"TinyBERT : Distilling BERT for Natural Language Understanding , October 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.652243Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:5140686f9f6813432936e854b10292e5f156074e308914f81535cd33fa9f96bc","observation_id":"7953ac66-43f5-4b25-a25c-99c2f4eace53","resolution":{"observed_at":"2026-08-11T05:17:55.652243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.656023Z","title":"Calc-x and calcformers: Empowering arithmetical chain-of-thought through interaction with symbolic systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.656023Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0b0070d32a03404662a83968aecf96920d5e09a30a8b77732e8fbfb5599d224a","observation_id":"c751306f-b105-4e1b-a7a1-8fda87d4eb45","resolution":{"observed_at":"2026-08-11T05:17:55.656023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.659548Z","title":"Kaplan, Sam McCandlish, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.659548Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6f903491feb59948a1d74e1604051f37ce453ace0f59685fd6ab9263bcc4d929","observation_id":"d7630e91-5b85-4337-a9ec-4517ff9cb306","resolution":{"observed_at":"2026-08-11T05:17:55.659548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.361","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:56.533170Z","title":"LAMBADA: backward chaining for automated reasoning in natural language","venue":null,"work_id":"fe9cd672-2e71-437b-bf96-92d0422ca7b7","year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.663382Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:72acf681dfe24af03e2dd5dc05e4c6d29a23db2fb968cf2de2a34315564390aa","observation_id":"792d3be0-7377-4567-be23-a8fbd389d9d1","resolution":{"observed_at":"2026-08-11T05:17:56.539446Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07490","last_updated":"2024-05-13T06:09:10Z","snapshot_observed_at":"2026-07-06T18:13:20.536375Z","submitted_at":"2024-05-13T06:09:10Z","title":"Strategic Data Ordering: Enhancing Large Language Model Performance through Curriculum Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07490","snapshot_observed_at":"2026-08-11T05:17:55.666929Z","title":"Strategic data ordering: Enhancing large language model performance through curriculum learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.666929Z"},"links":{"cited_paper":"/paper/2405.07490","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6fc533bd4f59167888e87ef69aab58588dd0c84b997aa5d191db91508ac3e37c","observation_id":"60c94e68-27d2-4cfe-ae69-1de60d8ecccf","resolution":{"observed_at":"2026-08-11T05:17:55.666929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.672190Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.672190Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:35d6fa7d455ad194962aa2c41a86d44a03fa1df6a48944f46dc9a2f252e1b254","observation_id":"4057b232-8906-43bd-8b28-ad50ea8af76f","resolution":{"observed_at":"2026-08-11T05:17:55.672190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-07T10:40:47.462532Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-11T05:17:55.676267Z","title":"Race: Large-scale reading comprehension dataset from examinations, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.676267Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7ed7756d19efd2125440c7b69cc67134c6697aca3f8a7bf8c327c705eb7e7dfa","observation_id":"1698723c-f8f3-438e-a616-b412cc3819df","resolution":{"observed_at":"2026-08-11T05:17:55.676267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T05:17:55.680324Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.680324Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e93f3b8ae6f3d0996d57d21e98d38870321332301af9d35f392c2670ec850fa8","observation_id":"3d73b432-089c-424a-ad9f-463f6bf7e903","resolution":{"observed_at":"2026-08-11T05:17:55.680324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18710","last_updated":"2025-03-25T11:11:03Z","snapshot_observed_at":"2026-07-06T18:21:44.232687Z","submitted_at":"2024-05-29T02:42:23Z","title":"To FP8 and Back Again: Quantifying Reduced Precision Effects on LLM Training Stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18710","snapshot_observed_at":"2026-08-11T05:17:55.684447Z","title":"To FP8 and back again: Quantifying the effects of reducing precision on LLM training stability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.684447Z"},"links":{"cited_paper":"/paper/2405.18710","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:03c9b010851addb9b8269ec67446b717652f599fd46f0b471ba3d0bd9979678c","observation_id":"e1f626a6-a936-45c9-830e-18f7d7523ff6","resolution":{"observed_at":"2026-08-11T05:17:55.684447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.688724Z","title":"The stability-efficiency dilemma: Investigating sequence length warmup for training GPT models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.688724Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:ebbcbda9f187d0d37377320ebe74b0e6c42a5abd87b04246659a4975f4acbb39","observation_id":"e646169e-494e-4935-aa76-3bc0cb5be7e1","resolution":{"observed_at":"2026-08-11T05:17:55.688724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.692410Z","title":"CMMLU: measuring massive multitask language understanding in chinese","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.692410Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:d3e87235392bbe4ff7dfb892154a147b6d105d819349220da454f1101206c811","observation_id":"ef7c6435-63ab-4922-b7b1-43c270f1fd16","resolution":{"observed_at":"2026-08-11T05:17:55.692410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-11T05:17:55.696737Z","title":"Pratt, Sunny Sanyal, Gabriel Ilharco, Giannis Daras, Kalyani Marathe, Aaron Gokaslan, Jieyu Zhang, Khyathi Raghavi Chandu, Thao Nguyen, Igor Vasiljevic, Sham M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.696737Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:409a4a0d23aefc9b5c82a43bf94c797259e5fa96b8d68e0146e804f72cb08289","observation_id":"0e8be959-aca8-4043-81cc-e0592cffea2d","resolution":{"observed_at":"2026-08-11T05:17:55.696737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.701333Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.701333Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2fb7fc3706a478e3d094b6c2aca8a844ffba1a88fb608e07636e5c416a07f9d7","observation_id":"200054d4-573d-4a44-9017-415b27af45b3","resolution":{"observed_at":"2026-08-11T05:17:55.701333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.704949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.704949Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:ccad01519cfdde3dad571497d476b44d433352bcabaa7046d470e33d93413e00","observation_id":"a1ecbb9f-8465-4419-9f0f-fc3cf894a521","resolution":{"observed_at":"2026-08-11T05:17:55.704949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.709214Z","title":"Slimorca: An open dataset of gpt-4 augmented flan reasoning traces, with verification, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.709214Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:f8c68fc787e1b557b4bb9a33fede8e1a766b97305954cf4af8d102fecc68195d","observation_id":"ab00372e-7f4b-4e68-9899-323b816fbd19","resolution":{"observed_at":"2026-08-11T05:17:55.709214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18820","last_updated":"2025-07-04T06:16:30Z","snapshot_observed_at":"2026-08-05T10:35:46.891754Z","submitted_at":"2024-06-27T01:28:30Z","title":"Universal Checkpointing: A Flexible and Efficient Distributed Checkpointing System for Large-Scale DNN Training with Reconfigurable Parallelis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18820","snapshot_observed_at":"2026-08-11T05:17:55.713062Z","title":"Universal checkpointing: Efficient and flexible checkpointing for large scale distributed training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.713062Z"},"links":{"cited_paper":"/paper/2406.18820","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:5e2529bf7b871f1474e4b7005da01d006e92123fd962349c8505dfb95eb951c1","observation_id":"51016bb6-ed26-4228-8ce7-e2a0cf89d0a7","resolution":{"observed_at":"2026-08-11T05:17:55.713062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.717656Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.717656Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b07ae4ee4cec89db0c7d084c7397f27fe1f0a2537517228d4194c99b49f35d55","observation_id":"71a195d8-08d9-429f-856f-f4e36eb3087e","resolution":{"observed_at":"2026-08-11T05:17:55.717656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10040","last_updated":"2025-03-15T12:25:58Z","snapshot_observed_at":"2026-08-09T03:59:21.839963Z","submitted_at":"2024-07-14T01:43:07Z","title":"Lean-STaR: Learning to Interleave Thinking and Proving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10040","snapshot_observed_at":"2026-08-11T05:17:55.721451Z","title":"Lean-star: Learning to interleave thinking and proving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.721451Z"},"links":{"cited_paper":"/paper/2407.10040","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e608dbcc008ba17b32947698fae15e6b3eeed5a49f73b3fb3555713064fca062","observation_id":"1d46ae2a-a2eb-42c1-9a4c-6d00d8b3d451","resolution":{"observed_at":"2026-08-11T05:17:55.721451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.725736Z","title":"Evaluating language models for efficient code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.725736Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:4c673dd95675fa3753c615eb3843849318cfb320884408dfc6d167939116ebbc","observation_id":"a0730987-ad22-477c-91cb-3dd1f406fe4b","resolution":{"observed_at":"2026-08-11T05:17:55.725736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.729586Z","title":"Longwanjuan: Towards systematic measurement for long text quality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.729586Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e08f27992c72a1d53a78f1a1ec8b3c21014966a3e0c20aa3863f88f1b3f068d8","observation_id":"332f812f-14f7-49cc-8a0b-bc98b5b1a394","resolution":{"observed_at":"2026-08-11T05:17:55.729586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.733247Z","title":"Iandola, Chen Lai, Yuandong Tian, Igor Fedorov, Yunyang Xiong, Ernie Chang, Yangyang Shi, Raghuraman Krishnamoorthi, Liangzhen Lai, and Vikas Chandra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.733247Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:192dc67d4a1873e5217d4c185cbe3cc5087ca59bf4449cd6158be735ea1bbeb3","observation_id":"372b526d-e9d4-499b-822f-e2b8c5ae2fc2","resolution":{"observed_at":"2026-08-11T05:17:55.733247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.736619Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.736619Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7f23a7c2050f5ffd806a6c8d91c688fed3a2c5a829bdfcc6c2047f3c666188d3","observation_id":"29198369-d345-492c-8104-5ef371e61085","resolution":{"observed_at":"2026-08-11T05:17:55.736619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.740267Z","title":"Fineweb-edu, May 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.740267Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a14af90e6eb7124aa23ad44a8603f802ade5e8dc534e146a106e67388940d830","observation_id":"0a8a1e71-1888-423c-b010-e3f41b4cfb23","resolution":{"observed_at":"2026-08-11T05:17:55.740267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-11T05:17:55.743567Z","title":"McAuley, Han Hu, Torsten Scholak, S \\' e bastien Paquet, Jennifer Robinson, Carolyn Jane Anderson, Nicolas Chapados, and et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.743567Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:26dca41b222a59f73bc2e68b3878b4430b763ba4066d1ce1aa85a357032144e8","observation_id":"ffbab978-eb00-4886-9b1e-9fa502d20b1e","resolution":{"observed_at":"2026-08-11T05:17:55.743567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.747649Z","title":"\\# instag: Instruction tagging for analyzing supervised fine-tuning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.747649Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:f9231e06d706df89e598608adb4450bf47ec6ed645edaddcc7a1eec626311264","observation_id":"e265e353-5c69-4eb7-8f90-70c410304222","resolution":{"observed_at":"2026-08-11T05:17:55.747649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T05:17:55.751805Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.751805Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:c60fbab56ec9800b10085af5fef0f15ad2539511744835b009c165a5c3afafa8","observation_id":"ada51368-6dfe-4c1f-85d8-d15a3b00a4aa","resolution":{"observed_at":"2026-08-11T05:17:55.751805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-11T05:17:55.755485Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.755485Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:17bde1f3601f0a5b09b74562f2090a0db26a7b03fcf614a716449cfa01e62e52","observation_id":"7682d8df-fb4c-48ac-9114-8ad3e7336eb1","resolution":{"observed_at":"2026-08-11T05:17:55.755485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03502","last_updated":"2024-07-03T21:01:12Z","snapshot_observed_at":"2026-08-10T23:24:12.708652Z","submitted_at":"2024-07-03T21:01:12Z","title":"AgentInstruct: Toward Generative Teaching with Agentic Flows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03502","snapshot_observed_at":"2026-08-11T05:17:55.759885Z","title":"Agentinstruct: Toward generative teaching with agentic flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.759885Z"},"links":{"cited_paper":"/paper/2407.03502","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a1563a205c80e8de2cee39260bb306af102ba463003c8e8be2c43236f40b199c","observation_id":"2888ad4e-50be-48ba-990a-1fe349f00bc8","resolution":{"observed_at":"2026-08-11T05:17:55.759885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-01T01:16:04.260529Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-08-11T05:17:55.764251Z","title":"Orca-math: Unlocking the potential of slms in grade school math","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.764251Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:241254af99c2b022e52138c6fb7986806ffd026915c4420d04a48766006555fd","observation_id":"20006ad7-ff15-436b-b12c-742bebf742df","resolution":{"observed_at":"2026-08-11T05:17:55.764251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-11T05:17:55.769456Z","title":"A theory on adam instability in large-scale machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.769456Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7b4fa68f91dd9fab0077b8ab4ac2cca3aa8dcb8f991ca72b173cea9bff5a56ed","observation_id":"c86fb826-818e-46aa-bd8a-a26fc2b0a430","resolution":{"observed_at":"2026-08-11T05:17:55.769456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01696","last_updated":"2016-04-06T17:15:10Z","snapshot_observed_at":"2026-08-02T13:14:17.832691Z","submitted_at":"2016-04-06T17:15:10Z","title":"A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01696","snapshot_observed_at":"2026-08-11T05:17:55.775045Z","title":"A corpus and evaluation framework for deeper understanding of commonsense stories, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.775045Z"},"links":{"cited_paper":"/paper/1604.01696","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:4174dc61654794b6bc511164e0e379801cf18153d946d089b22a3efd0855c028","observation_id":"20a028e5-506a-4f8a-b8b4-3fe06c836d58","resolution":{"observed_at":"2026-08-11T05:17:55.775045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.779633Z","title":"Initialization of large language models via reparameterization to mitigate loss spikes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.779633Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:eca9d415a11eb8bf2c14bc513f81f7d508dbd1c458a852457e721216ac2ca4ef","observation_id":"37f381ee-a220-45c8-b701-6757e7e54e4d","resolution":{"observed_at":"2026-08-11T05:17:55.779633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T05:17:55.783357Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.783357Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:bd1cd69d4f3f1f77a4e8c917e0d2d61dc58a647ae1780c712b7ed339a99b91a3","observation_id":"0d427be1-5e49-4c7f-8999-73dec0ad5d7b","resolution":{"observed_at":"2026-08-11T05:17:55.783357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.788805Z","title":"Opencsg/chinese-fineweb-edu Datasets at Hugging Face","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.788805Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:5305f6914fb167f71d9d6ae93d78cb8371d14855a37c181db02eab5508cf70d1","observation_id":"1a62bfcc-d9f6-461c-8325-421f6c18c33f","resolution":{"observed_at":"2026-08-11T05:17:55.788805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.793062Z","title":"Openwebmath: An open dataset of high-quality mathematical web text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.793062Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:1ef3dd17c5c7df559873e260a1ac6ac64b0fe319908a975122fe8352099f59f3","observation_id":"4025dfc6-5705-4989-93c8-9e057f581fd7","resolution":{"observed_at":"2026-08-11T05:17:55.793062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-11T05:17:55.796851Z","title":"The FineWeb Datasets : Decanting the Web for the Finest Text Data at Scale , October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.796851Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:ab7af2795d336fabbfed74cc2b06d0e9a40fd39935c0bf086ec50ee48a235761","observation_id":"8c045feb-349f-4345-b277-87987db0101a","resolution":{"observed_at":"2026-08-11T05:17:55.796851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.800922Z","title":"Using the output embedding to improve language models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.800922Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a542755661870f7b5f69d131649fd124a7a31f7f35c2e901629c7b806fb23843","observation_id":"b96506b3-2dd9-4ed0-9312-32ccf87930ef","resolution":{"observed_at":"2026-08-11T05:17:55.800922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.805088Z","title":"Bpe-dropout: Simple and effective subword regularization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.805088Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:776eb828e623e7b769acfeec3ee0f669f2f4a19984469554e49da93c2b6414ac","observation_id":"fb3f90b6-cd61-48ce-88a9-3167d0f6cd56","resolution":{"observed_at":"2026-08-11T05:17:55.805088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.809849Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.809849Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:ab0ebe27405c4a134a91790a5ecf7aae312e8c1ce1e385ec33fbb35683f503c3","observation_id":"dfd598b5-840e-401e-aea0-b701e6d112d4","resolution":{"observed_at":"2026-08-11T05:17:55.809849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.813910Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.813910Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7f8eb87ec9315152677a98d2131a588eead361ce7862f59e66af62e671acc1b3","observation_id":"cbb74a3b-c0d6-4000-9465-ace5f2b438af","resolution":{"observed_at":"2026-08-11T05:17:55.813910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.2020","last_updated":"2014-05-08T17:04:15Z","snapshot_observed_at":"2026-08-04T16:50:32.529025Z","submitted_at":"2014-05-08T17:04:15Z","title":"Generalized Slow Roll for Tensors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.2020","snapshot_observed_at":"2026-08-11T05:17:55.818112Z","title":"Zero: memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.818112Z"},"links":{"cited_paper":"/paper/1405.2020","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:f2091ca807871ab789ec314ab6c0dc7083ccd8b8b435040ed4685087f1d8cba3","observation_id":"11a5e7c4-1136-4352-8252-4ef5e130d539","resolution":{"observed_at":"2026-08-11T05:17:55.818112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16682","last_updated":"2024-10-22T04:27:03Z","snapshot_observed_at":"2026-08-07T04:01:58.724576Z","submitted_at":"2024-10-22T04:27:03Z","title":"Methods of improving LLM training stability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16682","snapshot_observed_at":"2026-08-11T05:17:55.822498Z","title":"Methods of improving LLM training stability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.822498Z"},"links":{"cited_paper":"/paper/2410.16682","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:1db95b0058925607cb1ccf953d37a56f343b3cecd2217980a59c7ed44a1996fb","observation_id":"98d016bd-757e-40a0-bc69-5d86bb7d5913","resolution":{"observed_at":"2026-08-11T05:17:55.822498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.826872Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.826872Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:9eb76da12dd35ed439c6496b6439cf2cab3cb5758912c4bff49f250fbb69be93","observation_id":"15560fa9-2c6a-46c7-85fa-55bd7bea687f","resolution":{"observed_at":"2026-08-11T05:17:55.826872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.830356Z","title":"Analysing mathematical reasoning abilities of neural models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.830356Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:ff4dfc4db6d11a2739335678d69fe6c35e9c3c8d2846aa726d3fd0798c0d1023","observation_id":"309525be-37af-4878-aa69-f0beef33a369","resolution":{"observed_at":"2026-08-11T05:17:55.830356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15424","last_updated":"2022-11-08T04:56:12Z","snapshot_observed_at":"2026-08-10T22:15:31.346947Z","submitted_at":"2022-10-27T13:43:27Z","title":"What Language Model to Train if You Have One Million GPU Hours?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15424","snapshot_observed_at":"2026-08-11T05:17:55.834003Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.834003Z"},"links":{"cited_paper":"/paper/2210.15424","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e7c11edf958d97ffb7c94c3a34f65740b599e0e192ad57497c931059bddac2a0","observation_id":"dd4fec3b-5f25-4c4d-860d-e6cf23ba19dc","resolution":{"observed_at":"2026-08-11T05:17:55.834003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-11T05:17:55.837609Z","title":"GLU variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.837609Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6f815e862fb9dfba1ff0d717a0a1dc3e035d76b791b61542f00ede17624bef64","observation_id":"50587157-1d42-495a-8d07-2e0c299bd7b7","resolution":{"observed_at":"2026-08-11T05:17:55.837609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.841726Z","title":"Reflexion: language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.841726Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:80e7b2bb3a89615bdd1123507d24d4cc1011f221a39202f05223c6627252f0f7","observation_id":"8730c3b9-df50-4f55-9cd3-42ff5cae83c1","resolution":{"observed_at":"2026-08-11T05:17:55.841726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-11T05:17:55.845648Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.845648Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:393c2d1ac4b20e5b5db7c1cea4c766881b307341bd6c48eb75dc64f3b783db11","observation_id":"49a2a1f1-c421-43ed-bf83-eeefaf70a699","resolution":{"observed_at":"2026-08-11T05:17:55.845648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.850860Z","title":"Scaling synthetic logical reasoning datasets with context-sensitive declarative grammars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.850860Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0f954f1ef06fe220e50895f75ad534778b67f855f7b91840cefa4a4fa76604f1","observation_id":"534693d8-74e2-48b1-87d9-c6c9ce775baa","resolution":{"observed_at":"2026-08-11T05:17:55.850860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.855080Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.855080Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:03edd6094e06dec0fa1f055d0695dbc36407438f55fc03aa9abdeb798f44725d","observation_id":"b8249ded-ee17-4de7-b738-8b9f07ef0f4b","resolution":{"observed_at":"2026-08-11T05:17:55.855080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.859191Z","title":"An integrated data processing framework for pretraining foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.859191Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7c46af4aff9791504f75e5ef716a14b0cf022f46d1aafdc97ba998d106b20856","observation_id":"067a34e9-01f5-4deb-ad99-eaf1f3bd5113","resolution":{"observed_at":"2026-08-11T05:17:55.859191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-08-10T02:05:33.826494Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-11T05:17:55.863452Z","title":"Spike no more: Stabilizing the pre-training of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.863452Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7795f15e72eff5b2a4b0fb5b75db8c648ed198e13f38c6aaf80152214dd56036","observation_id":"ebafdae7-2f71-4a6e-8c3a-b718eab9b0c1","resolution":{"observed_at":"2026-08-11T05:17:55.863452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.868198Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.868198Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6288d5b6b4416061b32cb247fd23c2387c6946a1d528f995dbd7c50850ea3cda","observation_id":"f6830659-a783-475b-91fb-768d22f64b1c","resolution":{"observed_at":"2026-08-11T05:17:55.868198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.872360Z","title":"LLMBox : A Comprehensive Library for Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.872360Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:158331886f81413c635d8cd39052978a5e88794e0e739b78ac410dad79e276c1","observation_id":"f0a4b540-0312-49a1-8aa8-e20ccd484eff","resolution":{"observed_at":"2026-08-11T05:17:55.872360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.877674Z","title":"Mathscale: Scaling instruction tuning for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.877674Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:c3bbc954b585297f0df37e372987eeb7a8b50ed179ee69915482e948a34959f2","observation_id":"b99b19bd-383b-440d-bc06-50cc5082675c","resolution":{"observed_at":"2026-08-11T05:17:55.877674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.881542Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.881542Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7229339a2af6f0589d754a6b5ba187b5ce678b4f8df1a9d1a704399a34cec6b9","observation_id":"2e309652-293c-493e-8eba-e2a1cf5f4941","resolution":{"observed_at":"2026-08-11T05:17:55.881542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.885313Z","title":"D4: improving LLM pretraining via document de-duplication and diversification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.885313Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:40789743485480f49b443ce87bf5d7c67211f22538847951c0295f92d3bfd5bf","observation_id":"d2abf91c-b95f-4497-b093-4e5a31d32053","resolution":{"observed_at":"2026-08-11T05:17:55.885313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-06T07:25:53.036005Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-11T05:17:55.889322Z","title":"Scaling law with learning rate annealing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.889322Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:699c7cdcf63826c7f767e05aeba4a5884cb01f4abce2c0f4fd25ce61b54ede89","observation_id":"743e5dc6-35c4-4390-8c15-ea78498a6d02","resolution":{"observed_at":"2026-08-11T05:17:55.889322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T05:41:25.377934Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":135},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 135 outbound references and 2 inbound Pith citation observations for arXiv:2412.17743."}