{"as_of":"2026-08-10T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5211ae95139e67a94844358937307155f342e3b70df81e8521e2eeb2aaf4660","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:49:40.374840Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T08:04:06.432613Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:48:39.719025Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":"2507.17634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-03T16:48:39.719025Z","title":"Aider-ai/aider, 2023a","venue":null,"work_id":"8e383889-fb69-4094-ac68-3f11209712c3","year":2025},"citing_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"reference_index":222,"source":"pdf_text","source_observed_at":"2026-05-17T22:16:04.386706Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2408.07666"},"observation_digest":"sha256:f459130bc7ce9241b377cf7d57eb44f0a2386101cad2c7573f672a21f7ae8dc8","observation_id":"e5a9069d-4f1c-40a3-96cc-fe6071bece89","resolution":{"observed_at":"2026-05-17T22:16:04.630970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":"2507.17634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-03T16:48:39.719025Z","title":"Aider-ai/aider, 2023a","venue":null,"work_id":"8e383889-fb69-4094-ac68-3f11209712c3","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:ef270953d67f27811e30961aa24a6ee4bf38a3b19e6030876329232ab74dc45b","observation_id":"28d0e392-e39a-4e9d-97eb-ce31a2ebb1e0","resolution":{"observed_at":"2026-05-14T18:53:21.153791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":"2507.17634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-03T16:48:39.719025Z","title":"Aider-ai/aider, 2023a","venue":null,"work_id":"8e383889-fb69-4094-ac68-3f11209712c3","year":2025},"citing_paper":{"arxiv_id":"2604.11446","last_updated":"2026-04-13T13:28:12Z","snapshot_observed_at":"2026-08-10T21:33:46.434423Z","submitted_at":"2026-04-13T13:28:12Z","title":"Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:20.180349Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2604.11446"},"observation_digest":"sha256:6b6a173e7601cb469ad2a08179bf49e252b2cdb35b60bdf1b43ebb4f18a1f0f7","observation_id":"9a673bd1-0782-431b-b822-ae5f7cfa19aa","resolution":{"observed_at":"2026-05-11T09:16:04.606637Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":"2507.17634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-03T16:48:39.719025Z","title":"Aider-ai/aider, 2023a","venue":null,"work_id":"8e383889-fb69-4094-ac68-3f11209712c3","year":2025},"citing_paper":{"arxiv_id":"2604.12163","last_updated":"2026-04-14T00:43:23Z","snapshot_observed_at":"2026-08-02T18:33:05.096448Z","submitted_at":"2026-04-14T00:43:23Z","title":"Nucleus-Image: Sparse MoE for Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:30:46.994872Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2604.12163"},"observation_digest":"sha256:ff62c8e0c9d5ac0bbbd62bbedec137284c18748d11428778101ab9a874948368","observation_id":"da5f2e47-57cc-4cf2-96e2-cf75387d6980","resolution":{"observed_at":"2026-05-11T10:26:00.500863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":"2507.17634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-03T16:48:39.719025Z","title":"Aider-ai/aider, 2023a","venue":null,"work_id":"8e383889-fb69-4094-ac68-3f11209712c3","year":2025},"citing_paper":{"arxiv_id":"2606.05610","last_updated":"2026-06-04T02:32:11Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T02:32:11Z","title":"Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T01:53:04.715108Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2606.05610"},"observation_digest":"sha256:e7d1071b736406267c1a8782aef6170242b030e87cecad12577bf735cdabef67","observation_id":"03f0c8e7-2dbf-42b5-9192-ee498d954630","resolution":{"observed_at":"2026-07-02T12:46:56.726091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":"2507.17634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-03T16:48:39.719025Z","title":"Aider-ai/aider, 2023a","venue":null,"work_id":"8e383889-fb69-4094-ac68-3f11209712c3","year":2025},"citing_paper":{"arxiv_id":"2607.02291","last_updated":"2026-07-02T15:08:56Z","snapshot_observed_at":"2026-08-07T15:44:37.020127Z","submitted_at":"2026-07-02T15:08:56Z","title":"Optimizing Visual Generative Models via Distribution-wise Rewards","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T16:39:12.711424Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2607.02291"},"observation_digest":"sha256:dbc7025d9d9f2c8e4213c483843eaa3e9bba8b1c965e65fa1239fbe58a77fe05","observation_id":"faf207a2-565d-44f8-93f8-594a43b59c56","resolution":{"observed_at":"2026-07-03T16:48:39.720432Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17634","snapshot_observed_at":"2026-07-14T08:04:06.432613Z","title":"arXiv preprint arXiv:2507.17634 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10959","last_updated":"2026-07-12T23:24:42Z","snapshot_observed_at":"2026-08-03T13:16:14.672928Z","submitted_at":"2026-07-12T23:24:42Z","title":"WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-14T08:04:06.432613Z"},"links":{"cited_paper":"/paper/2507.17634","citing_paper":"/paper/2607.10959"},"observation_digest":"sha256:311d2650139b1a804ef81dd03dd1b2bab857759ff7f3283ea36c6f45794afd0d","observation_id":"946f17a8-297a-41de-843e-b5edf6e0d030","resolution":{"observed_at":"2026-07-14T08:04:06.432613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17634/citation-record","integrity":"/paper/2507.17634/integrity","json":"/paper/2507.17634/citation-record.json","paper":"/paper/2507.17634"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.161054Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.161054Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:e0e6e106572d47cef289cd8425cec51e6205db7caf9bcf90c74cdc7e39ab1c6c","observation_id":"b40b8c51-98bd-4592-9a8a-ea78cbd8178f","resolution":{"observed_at":"2026-08-06T14:49:40.161054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00698","last_updated":"2025-04-14T12:37:51Z","snapshot_observed_at":"2026-08-07T16:17:41.511601Z","submitted_at":"2025-04-01T12:08:07Z","title":"Command A: An Enterprise-Ready Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00698","snapshot_observed_at":"2026-08-06T14:49:40.164771Z","title":"e l Avalos, Zahara Aviv, Sammie Bae, Saurabh Baji, Alexandre Barbet, Max Bartolo, Bj \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.164771Z"},"links":{"cited_paper":"/paper/2504.00698","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:ef329492e78c2e7dbbb53d3ba7c5b6709775701abfb47b5ecbc8cf19f9561b29","observation_id":"e5c0682f-0a66-4e98-9e9f-94ecc31f50b9","resolution":{"observed_at":"2026-08-06T14:49:40.164771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.168634Z","title":"GQA: training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.168634Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a3645b2f2d50f03b4487c2e59059d7ce6976cad497c8ea6737749a6e06dc631f","observation_id":"af7cc77a-cbd0-4bf7-8520-8567d0c59a48","resolution":{"observed_at":"2026-08-06T14:49:40.168634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.948774Z","title":"Singular value decomposition for genome-wide expression data processing and modeling","venue":null,"work_id":"16b11e54-4157-4344-835c-d506dc1e8533","year":2000},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.171452Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:1ac00e11d20453dfd66ecfdf6c33a09874ca4851d604b9b91038dbac502befc3","observation_id":"7653a452-a6eb-4708-9b21-6b8f59e459ad","resolution":{"observed_at":"2026-08-06T14:49:40.951863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-07T11:38:07.397956Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-06T14:49:40.174037Z","title":"Efficient training of language models to fill in the middle","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.174037Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:20aa95d80ec5ee9868fa9e900d053fc00754d78e26ed3fc09b5ac033474eed65","observation_id":"bf4ac10f-53f1-4cd0-96a7-47579c692fe4","resolution":{"observed_at":"2026-08-06T14:49:40.174037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03315","last_updated":"2021-02-05T17:41:43Z","snapshot_observed_at":"2026-08-04T00:22:28.888492Z","submitted_at":"2021-02-05T17:41:43Z","title":"Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.03315","snapshot_observed_at":"2026-08-06T14:49:40.177307Z","title":"Think you have solved direct-answer question answering? try arc-da, the direct-answer AI2 reasoning challenge","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.177307Z"},"links":{"cited_paper":"/paper/2102.03315","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:37313d4a7502c57d2282520e66626358f0faddf13f5d4964bcccf315a5b0c207","observation_id":"1d0af229-8979-4c47-833e-111f69af968c","resolution":{"observed_at":"2026-08-06T14:49:40.177307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.180214Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.180214Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:0bc871e7e63784b7daa353c964def08bd3d54ae04c64a3f5d7bbe8a5e3f0c55e","observation_id":"4c452095-68dd-4574-9f1b-931eb1cd1d41","resolution":{"observed_at":"2026-08-06T14:49:40.180214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T14:49:40.183110Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.183110Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a45577142425771cdab6c57f9a8ece0688687d75f864ad9175effd8eca2a251b","observation_id":"44ed7f98-a06d-4b5e-bf2e-b71b4ef485e4","resolution":{"observed_at":"2026-08-06T14:49:40.183110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T14:49:40.186163Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.186163Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:af8a74762ecc62f84b2d1f6b280a4facb5da243cd8bb7a28a8ca08d969180b9b","observation_id":"48ff99f4-5945-4f0f-93bd-03462c4a5d28","resolution":{"observed_at":"2026-08-06T14:49:40.186163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T14:49:40.189875Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.189875Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:8e638704980d9d70c8f14997293b9e2b416289f4b049dbe9d451aeb049f570b3","observation_id":"1ddb38eb-9df7-4a41-b576-9e4050683a22","resolution":{"observed_at":"2026-08-06T14:49:40.189875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07831","last_updated":"2024-10-29T22:57:44Z","snapshot_observed_at":"2026-08-10T17:36:37.497578Z","submitted_at":"2023-10-11T19:16:35Z","title":"Optimal Linear Decay Learning Rate Schedules and Further Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07831","snapshot_observed_at":"2026-08-06T14:49:40.192955Z","title":"Optimal linear decay learning rate schedules and further refinements","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.192955Z"},"links":{"cited_paper":"/paper/2310.07831","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:8021f32fdfda229ac384e5106604f403f667e23ebf891192443c1eb5d4841ac2","observation_id":"9f23933e-377f-4d5a-812e-ac93845b4613","resolution":{"observed_at":"2026-08-06T14:49:40.192955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.941719Z","title":"The road less scheduled","venue":null,"work_id":"d3e006a8-e250-478e-9626-94f574dd0a96","year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.195837Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:e4eab63eda0ca249d62e15658abcf52beac80393a7a9a3b585b85b45dba4dcc8","observation_id":"203545ba-b5b0-4689-8d7b-921ea7f367f0","resolution":{"observed_at":"2026-08-06T14:49:40.944051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.933878Z","title":"Ernie 4.5 technical report, 2025","venue":null,"work_id":"75fa3fa5-4df7-4dbe-b44b-445022297ee9","year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.198545Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:21a821b67c3320d05c82f8760c41fd681491c4f49487f5e04c7e8e5cbfe0dc8a","observation_id":"86616692-7305-4c4c-a24b-b033ff50d23a","resolution":{"observed_at":"2026-08-06T14:49:40.936385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.926786Z","title":"A closer look at deep learning heuristics: Learning rate restarts, warmup and distillation","venue":null,"work_id":"44de7dd0-c854-4704-b3de-2137b36b4ffd","year":2019},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.201212Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:50f789e94859c7719436b8ef37e828d901f604e9d204a306bcaf6200499f56ae","observation_id":"eb8d68e8-e2b1-440e-8eb8-c05cad23f7a8","resolution":{"observed_at":"2026-08-06T14:49:40.929541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T14:49:40.203886Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.203886Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:5bc5735215575c87d090256679c796069f4848901d373650b00c3d9789b160cc","observation_id":"4a9488bd-2143-49cf-83f2-7c3034dbff2c","resolution":{"observed_at":"2026-08-06T14:49:40.203886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.919005Z","title":"Cruxeval: A benchmark for code reasoning, understanding and execution","venue":null,"work_id":"ac33c5cd-6de5-4988-9210-de2eb0df5e42","year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.206838Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:f9aa67dc2f25bb55d0c26bfc66d6efb99fcaba09ff65282cfb1094275ccd4a1f","observation_id":"8e031a19-d770-4c7a-bbdc-97905fb8be40","resolution":{"observed_at":"2026-08-06T14:49:40.921888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.911527Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"598a04fd-9139-492b-bc2d-07fae9c61997","year":2021},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.209532Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:826d5bce6ad618c837a5c72a8690132339e522d1bd81031fc61e7a23ebc94ff1","observation_id":"767a9476-fe71-4897-b757-2b355ffabbef","resolution":{"observed_at":"2026-08-06T14:49:40.914354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.904044Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"df40a980-cb87-491d-b12a-82021ba2618c","year":2021},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.212327Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:1e503a1cfc1569e554b732c1608b81b3d868b99d1086d4998828cfa39659e2f4","observation_id":"600bdd67-00bd-445c-8465-8d0366ce6c02","resolution":{"observed_at":"2026-08-06T14:49:40.906979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T14:49:40.215478Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.215478Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:dcc9d22be233217c79c904a5cddce602d63e034dd31c6aa4a89988e414c4d825","observation_id":"dd226e5d-e9d6-4aec-9d45-36a5b290fe05","resolution":{"observed_at":"2026-08-06T14:49:40.215478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-06T14:49:40.219276Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.219276Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:e8f117b1fd839294c0da2ad0dbf82ee850d2e0d457e9f1582319f3c56383f02e","observation_id":"316f645f-0a47-4f65-80f9-6fdbbba51394","resolution":{"observed_at":"2026-08-06T14:49:40.219276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T14:49:40.223058Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.223058Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:2105f9b9dafd2cbc3a8a72fd17ab415caa7cc9fb37233bc367124c1c0f3ba2a9","observation_id":"5e736d96-9b1f-406d-b8ca-ef0cc1f07da7","resolution":{"observed_at":"2026-08-06T14:49:40.223058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.896230Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"35619ea6-b56e-43d0-9feb-91ae219efb9a","year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.226927Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a7b0154bfa99782946b32df23db4f8bd3c5ebd779ec3492b7c489b0ddcd7e658","observation_id":"a8ee7ec0-676a-472c-852a-bd82e31f2d90","resolution":{"observed_at":"2026-08-06T14:49:40.899199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.888419Z","title":"Richter, Quentin Gregory Anthony, Eugene Belilovsky, Timoth \\' e e Lesort, and Irina Rish","venue":null,"work_id":"8e2f0789-8f3c-4eef-ab65-130c2ed91ed6","year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.229513Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:d9ac2919b761b256c1811259bb6a9ee37492ae906924ba2e9b583324e084cb36","observation_id":"e78238f1-43f9-48f5-929f-c3c107944b12","resolution":{"observed_at":"2026-08-06T14:49:40.891363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.880479Z","title":"Vetrov, and Andrew Gordon Wilson","venue":null,"work_id":"02869029-ca52-4b46-9e9a-0827118283c4","year":2018},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.232083Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:3af7a84243bbfe625072b18040643950f5a8e8249048e8d0eec01537a559730f","observation_id":"26fc44d2-0d2a-4f90-96d8-e09ce6d05f58","resolution":{"observed_at":"2026-08-06T14:49:40.883249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.235282Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.235282Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:e6213a89e183381504b3c8e5d92c564add1edcc6cde79a6c48f567818bfca00c","observation_id":"97bc146a-f747-4825-ad5a-187d111e6a86","resolution":{"observed_at":"2026-08-06T14:49:40.235282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8952.2023","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.712465Z","title":"Rethinking learning rate tuning in the era of large language models","venue":null,"work_id":"633f1d07-c568-4640-97f0-7854afc25384","year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.237678Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:68da6059bd956648d31c97ab9ae10b0bcd55aeae949537b40c25ddef886c22f2","observation_id":"3c8a01b1-70b3-4eab-9769-b3b40af967c0","resolution":{"observed_at":"2026-08-06T14:49:40.718320Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.241618Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.241618Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:8fee1f0748b847e1c8502e40309b3cafae2f436378e13c9b2bc088eba12d14e2","observation_id":"fe181627-fec2-42d5-a385-46f2f81ed036","resolution":{"observed_at":"2026-08-06T14:49:40.241618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14981","last_updated":"2022-10-06T17:57:36Z","snapshot_observed_at":"2026-08-07T10:12:16.147632Z","submitted_at":"2022-09-29T17:46:13Z","title":"Stop Wasting My Time! Saving Days of ImageNet and BERT Training with Latest Weight Averaging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14981","snapshot_observed_at":"2026-08-06T14:49:40.244546Z","title":"Stop wasting my time! saving days of imagenet and BERT training with latest weight averaging","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.244546Z"},"links":{"cited_paper":"/paper/2209.14981","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:56349b16f127d4e6dc1ae0f1743fa50ccfd2495287979ce137b1f85573e4e7ef","observation_id":"3c208857-404e-4fda-86fe-b1e9232e2a17","resolution":{"observed_at":"2026-08-06T14:49:40.244546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T14:49:40.247566Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.247566Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:6085d18827ddd5036d4b78aa532f5da01c19841afed0557e9da0b1f2b65ac963","observation_id":"e6f4d678-8373-4e81-9269-194552a071d2","resolution":{"observed_at":"2026-08-06T14:49:40.247566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T14:49:40.250757Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.250757Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:ccf15b16f6382f27fefb07ed515d364ecbfa7f112ae00ea33464c03ffe8dc70a","observation_id":"0986341d-8cb4-4960-a89a-78a9fe9f17a7","resolution":{"observed_at":"2026-08-06T14:49:40.250757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.255037Z","title":"Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones, Matthew Kelcey, Ming - Wei Chang, Andrew M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.255037Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:30c06b50eaf9f50fb19db49c9945070b8433771775f52b211578d2874c015cae","observation_id":"b6b156b9-734c-46c3-bc7d-79d25f64b4f4","resolution":{"observed_at":"2026-08-06T14:49:40.255037Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.258558Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.258558Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:ef268240bc89a3bcbc566f1a676314a30228777e5b30922bb91bc44daf848b50","observation_id":"c2d43276-78d1-4e4d-80d5-111c6b495cec","resolution":{"observed_at":"2026-08-06T14:49:40.258558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.261471Z","title":"CMMLU: measuring massive multitask language understanding in chinese","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.261471Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:557b4cac5bf4cfb8918e420604298bd62a63d4c549e56c7bec58b36e1cdbfb1e","observation_id":"92810c51-2ae3-4353-a885-12bdda675a2d","resolution":{"observed_at":"2026-08-06T14:49:40.261471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.264278Z","title":"Gsm-plus: A comprehensive benchmark for evaluating the robustness of llms as mathematical problem solvers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.264278Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:7e8a2e43d8c38eee9b282ebde488a0426182fef12e88d84e00c448b40c9f834a","observation_id":"80457c3f-2016-4f98-a019-eb28e5a8d60f","resolution":{"observed_at":"2026-08-06T14:49:40.264278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.868530Z","title":"Trainable weight averaging: Efficient training by optimizing historical solutions","venue":null,"work_id":"6c9ded74-7ad0-4164-90c4-9b45683fcfe3","year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.267452Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:ec33025e7d2cea525ffea2078ba53acc1727c26793f4aefe60e2721b76ff8aac","observation_id":"ff6b0366-0353-4801-b059-198f28d01ab6","resolution":{"observed_at":"2026-08-06T14:49:40.871354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-09T20:21:57.212243Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-08-06T14:49:40.270904Z","title":"Model merging in pre-training of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.270904Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a37323a866cd13455b4422d6166bb9afc756724f2f70ad2fb02317c1862c7fb3","observation_id":"b01d7e69-effd-4359-869c-aaa6507bee03","resolution":{"observed_at":"2026-08-06T14:49:40.270904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05139","last_updated":"2025-03-10T14:21:21Z","snapshot_observed_at":"2026-08-07T23:26:41.225259Z","submitted_at":"2025-03-07T04:43:39Z","title":"Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05139","snapshot_observed_at":"2026-08-06T14:49:40.275301Z","title":"Every flop counts: Scaling a 300b mixture-of-experts ling llm without premium gpus","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.275301Z"},"links":{"cited_paper":"/paper/2503.05139","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:afb74765dd364d576c0541d6c975aaece539689d41f7c2d9ce8eb0e6f1430c41","observation_id":"7393a6f6-d761-4dd3-a0c7-e5030d5fad5a","resolution":{"observed_at":"2026-08-06T14:49:40.275301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19390","last_updated":"2025-06-03T06:01:14Z","snapshot_observed_at":"2026-07-06T17:52:30.328601Z","submitted_at":"2024-03-28T13:01:18Z","title":"Checkpoint Merging via Bayesian Optimization in LLM Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19390","snapshot_observed_at":"2026-08-06T14:49:40.278771Z","title":"Checkpoint merging via bayesian optimization in LLM pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.278771Z"},"links":{"cited_paper":"/paper/2403.19390","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:e013653009a1aba8fbd7f9509a7ad81313f322a0de3e349d53bf76d2b860e458","observation_id":"04763bb9-e42d-4b7d-98ae-5d4af2c4573e","resolution":{"observed_at":"2026-08-06T14:49:40.278771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.282544Z","title":"Mathbench: Evaluating the theory and application proficiency of llms with a hierarchical mathematics benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.282544Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:6dc2d5c9b43d3b48a7a3f47434fa193c70218d650cfdd13e5b31b16dc716984b","observation_id":"fdd15129-6fde-4231-b630-e247e463f365","resolution":{"observed_at":"2026-08-06T14:49:40.282544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.856743Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"8588f426-8603-481f-83d8-0b5b50169405","year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.285010Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:c42960b832ff414b77e7d221e5761537ff6d3dd6678148264a9cd908e7bfd82b","observation_id":"6aaa4fbe-0b1f-4f4d-bdd9-5eb9434c5cd2","resolution":{"observed_at":"2026-08-06T14:49:40.859947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-06T14:49:40.287585Z","title":"Muon is scalable for llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.287585Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:9e1e53855d0ebdde51963463b887c40ba9b05315f0869c488702fb6448b07d7f","observation_id":"00bf9dac-1894-4206-ae92-115eddcfa730","resolution":{"observed_at":"2026-08-06T14:49:40.287585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.849327Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a55ede04-d7f7-4e05-bb25-738130dfe697","year":2019},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.290756Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:ae4dabb0011994b60857ecf75633719e1833263b3798fa6fc9713786b4b717e5","observation_id":"49a61f1f-3ff0-4842-8d7e-6258c9900bd3","resolution":{"observed_at":"2026-08-06T14:49:40.852087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.841504Z","title":"Kor-bench: Benchmarking language models on knowledge-orthogonal reasoning tasks","venue":null,"work_id":"18bc13dc-cfa5-42db-b79c-52abff868de1","year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.293880Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:e4790b66b5ea220708d8e00789a6d09e213bbd5aef7b7e577efb62ea06bc8fef","observation_id":"ad685db0-d7e0-46b9-8969-896301d0f5ea","resolution":{"observed_at":"2026-08-06T14:49:40.844328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.296436Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.296436Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a735e67c22076cfa39eabf39fce7069b44244740a3c2193dae0eaa7182fd58e4","observation_id":"80ef4eb8-0795-49b4-9394-ebe5812f7620","resolution":{"observed_at":"2026-08-06T14:49:40.296436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.832462Z","title":"Humaneval-xl: A multilingual code generation benchmark for cross-lingual natural language generalization","venue":null,"work_id":"10d49fbd-2500-4158-a339-d6279265ebd7","year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.298941Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:6bf4e4e55b5407fbd32f706a393dc3d94a2d41e59294798c053f8bde8f51a767","observation_id":"fd8ca48f-a9e5-4982-bb70-25a8150f586e","resolution":{"observed_at":"2026-08-06T14:49:40.836404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.302393Z","title":"Acceleration of stochastic approximation by averaging","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.302393Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:f924555f328dab8dd71f086f14abdebd2a75515ecb90894a4b02c5cd4e556752","observation_id":"d441faa6-5beb-4307-b58b-e070c24e151c","resolution":{"observed_at":"2026-08-06T14:49:40.302393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.305913Z","title":"Know what you don't know: Unanswerable questions for squad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.305913Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:b43a8c599725a1e64378293d6b9502d52dcbf9bd0be08035e0f136eb7d5d5220","observation_id":"6b2617c9-22da-4f45-a52e-e38e97ebe2cf","resolution":{"observed_at":"2026-08-06T14:49:40.305913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-06T19:03:17.469282Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-06T14:49:40.309508Z","title":"WARP: on the benefits of weight averaged rewarded policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.309508Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:b4aed6856005554c012828676587007bf0a0d5e6bd7174807cc8cf2fe1e17284","observation_id":"f45b4229-3401-43fd-821a-02d59d43cf5c","resolution":{"observed_at":"2026-08-06T14:49:40.309508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T14:49:40.313269Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.313269Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:c9dba6ece8eb0071bea4efa59971600edbd395e032019ea5cce2c96adc6b5dbb","observation_id":"c88fe0e4-73e4-4e04-aed1-ba08bb7f98bd","resolution":{"observed_at":"2026-08-06T14:49:40.313269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.820998Z","title":"The effective rank: A measure of effective dimensionality","venue":null,"work_id":"f9fbc9d5-0326-472e-9d7c-5851ed892164","year":2007},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.317041Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:828542322e3037f75d209ff75acdb6152a1ca2c1333a4b73641227b9b63b7b0d","observation_id":"8e4937d0-9314-4a55-84ac-e2315a2e4758","resolution":{"observed_at":"2026-08-06T14:49:40.823812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.319980Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.319980Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a51bdd0aecd8d601c5e1658d675806a2c81fc04e6326e89d6407a8f4f5775f3c","observation_id":"55aeede7-6672-4f15-a676-ca48906940a7","resolution":{"observed_at":"2026-08-06T14:49:40.319980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02312","last_updated":"2023-02-01T07:08:58Z","snapshot_observed_at":"2026-08-10T08:59:41.862068Z","submitted_at":"2023-01-05T21:58:46Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02312","snapshot_observed_at":"2026-08-06T14:49:40.322544Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.322544Z"},"links":{"cited_paper":"/paper/2301.02312","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:6fd9f88e923a3d4af72c71efd3341b286738ebc938461920a01b695c90d2f511","observation_id":"9f1d570c-bd0e-43dd-801f-db8643107920","resolution":{"observed_at":"2026-08-06T14:49:40.322544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03241","last_updated":"2023-12-11T22:31:12Z","snapshot_observed_at":"2026-07-06T15:38:54.127539Z","submitted_at":"2023-06-05T20:51:44Z","title":"Early Weight Averaging meets High Learning Rates for LLM Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03241","snapshot_observed_at":"2026-08-06T14:49:40.325724Z","title":"Early weight averaging meets high learning rates for llm pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.325724Z"},"links":{"cited_paper":"/paper/2306.03241","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:40a4f0792994ab07f3f168fc2bfb3770df5405946c0c59a0be536ed242a7313d","observation_id":"73da079d-8e71-47cf-b9bd-b020e6655d68","resolution":{"observed_at":"2026-08-06T14:49:40.325724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.813296Z","title":"Language models are multilingual chain-of-thought reasoners","venue":null,"work_id":"c070d40a-2187-4eac-99b5-4845d17dd01c","year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.329489Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:96e6c28d2c52c17834f8288ac79b221e8e9b6053e04febf4b7dbaf50310f9960","observation_id":"7c6ee47d-7fbd-47c8-86ba-445a33954511","resolution":{"observed_at":"2026-08-06T14:49:40.816226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.806249Z","title":"Through the river: Understanding the benefit of schedule-free methods for language model training","venue":null,"work_id":"646dbcf8-1605-4485-a707-c84a89152a7f","year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.333234Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:add5a3061a1a9e76ac4e6ff040c7c33d5f58a3cd60bdf5b1e7314db15e676b2e","observation_id":"1cce468c-e7dd-4ef1-9218-fe5adff6e048","resolution":{"observed_at":"2026-08-06T14:49:40.808956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.335742Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.335742Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:c34322d49efcce7d8092bae56b2f72bc7f7b48761b1ebc497804e26f81ddd395","observation_id":"4204b1e0-83ec-411d-9f30-1c2abe880c2b","resolution":{"observed_at":"2026-08-06T14:49:40.335742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.338371Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.338371Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a0c311d99230b997feb756209dd8e2cc040863c9c9f25ddd7f635cc3eeb475a5","observation_id":"ea764802-3135-4306-af8b-8d21c68ddba5","resolution":{"observed_at":"2026-08-06T14:49:40.338371Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.798506Z","title":"Mathscale: Scaling instruction tuning for mathematical reasoning","venue":null,"work_id":"e0411c23-41bc-418f-8187-e1eaca76c57c","year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.341316Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:8ebf7f3da142385245131adaa64d352c8de3e7b652a80be941ef85e325c3490c","observation_id":"f812d33d-5413-472e-b7fc-955f835f8f3b","resolution":{"observed_at":"2026-08-06T14:49:40.801334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.344028Z","title":"Enhancing program synthesis with large language models using many-objective grammar-guided genetic programming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.344028Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:456e94eafb1c0b75720e2b743d39239ee081d37f59f9368b47b11d569af1e7ab","observation_id":"f4ea028c-ef97-4992-9152-210cc5ee25d2","resolution":{"observed_at":"2026-08-06T14:49:40.344028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-06T14:49:40.346687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.346687Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:f467abb84bb57033081a33f9924f7c1d7cc64617f575fa4bb8eb9507d0cadb68","observation_id":"0027e135-283e-4e1f-9a36-87ef21193dba","resolution":{"observed_at":"2026-08-06T14:49:40.346687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.791022Z","title":"Visualizing data using t-SNE","venue":null,"work_id":"2e66098b-3fea-4082-bd31-8b30aec28585","year":2008},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.349777Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:dff17435f5fbec13841f59037aae77ecb77109e0663b063056fb371888dba4a5","observation_id":"d294a735-8dde-4bab-99cb-21384f5ecf60","resolution":{"observed_at":"2026-08-06T14:49:40.793666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.783164Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"914de532-f279-4ca9-84a1-4737e796731f","year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.352418Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:afbb46020857322168569905b335680faff6e0e42c5b6da01d633061424dee9f","observation_id":"f28e7aef-5bda-4e5e-9835-af7e705c1959","resolution":{"observed_at":"2026-08-06T14:49:40.786032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16636","last_updated":"2023-06-29T02:19:50Z","snapshot_observed_at":"2026-08-09T19:17:03.002158Z","submitted_at":"2023-06-29T02:19:50Z","title":"CMATH: Can Your Language Model Pass Chinese Elementary School Math Test?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16636","snapshot_observed_at":"2026-08-06T14:49:40.355079Z","title":"CMATH: can your language model pass chinese elementary school math test? CoRR, abs/2306.16636, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.355079Z"},"links":{"cited_paper":"/paper/2306.16636","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:fc2b3e0343ebbe28740207a3be87c85b49333de93004c6989136f625979c5bcf","observation_id":"e3538294-b9c8-4b01-8041-8c5902f68996","resolution":{"observed_at":"2026-08-06T14:49:40.355079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-06T14:49:40.357950Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.357950Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:b7dac657315a94a4579350856d7cff444e9116f0e351f828e78b779a549bb1a0","observation_id":"448880cd-8952-4b5d-af44-e21859de42a6","resolution":{"observed_at":"2026-08-06T14:49:40.357950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.775490Z","title":"Morcos, Hongseok Namkoong, Ali Farhadi, Yair Carmon, Simon Kornblith, and Ludwig Schmidt","venue":null,"work_id":"bf5c3ddc-eba1-4aaa-96b8-bd72494f18a2","year":2022},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.360788Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:ae6e52f4fa99f1e0405945b0bc6563809c4f25cb93cda5b5b44142539b329efa","observation_id":"4900d096-1dbc-4dbe-a105-665d9c9757d0","resolution":{"observed_at":"2026-08-06T14:49:40.778343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.363376Z","title":"Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.363376Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a9327a7303120301b0048f0c2c009580cac864330bf515d8299e08188dcda501","observation_id":"99940e47-70b3-4835-96e4-0630566f407a","resolution":{"observed_at":"2026-08-06T14:49:40.363376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.768555Z","title":"Foster, and Sham M","venue":null,"work_id":"6771b325-9965-44c8-8c61-715b367e4c0e","year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.366670Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:c8a9add1ec444f658c2fa39d385923d5c36784d918d0d06ab77d6ec42d6c9bc9","observation_id":"1ae4fb1b-a952-4491-b770-84f014fa9064","resolution":{"observed_at":"2026-08-06T14:49:40.771043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.761352Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":"22caff07-4ef9-4df8-b7f6-b2bfa5f26f79","year":2020},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.369002Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:21b84e72c2be281a57f7f6d4a6ad18dbb55ea74c668f301937045eb46d39a6c0","observation_id":"3075dbd0-d7ad-43e0-bed6-b43256ac86dd","resolution":{"observed_at":"2026-08-06T14:49:40.763979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-08T08:58:54.609425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-06T14:49:40.371463Z","title":"Evaluating the performance of large language models on GAOKAO benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.371463Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:00d816c46d094112e8cf8825d00496e1156480c52e4f4fea1df33905ac35e086","observation_id":"9435e165-90f4-4332-b5e9-359316fbaa19","resolution":{"observed_at":"2026-08-06T14:49:40.371463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:49:40.374840Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.374840Z"},"links":{"citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:56c28f096a87fcd03411bedab3a1547e5fe1c30a632703674dc91854125fbb09","observation_id":"f730784f-86c2-46b1-9910-f09757b42636","resolution":{"observed_at":"2026-08-06T14:49:40.374840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T19:16:35.269127Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 7 inbound Pith citation observations for arXiv:2507.17634."}