{"as_of":"2026-08-06T12:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e308bc2ce3cf3551a4f18369231d6ff598eb15f9aa431bf51578c13a235aa52f","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T20:00:47.126736Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.13405/citation-record","integrity":"/paper/2605.13405/integrity","json":"/paper/2605.13405/citation-record.json","paper":"/paper/2605.13405"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.540307Z","title":"Bergsma, B","venue":null,"work_id":"a7caf177-64bd-4bbb-9f0d-cf67cf518292","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:0184830e8b23a95220d75413aa04cc57a1e5328ec06adc1fe7c5a6dd5d2bcacb","observation_id":"166c4dd5-d84a-4117-a34d-b56503e7dd2b","resolution":{"observed_at":"2026-05-14T20:02:52.971842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, B","venue":null,"work_id":"f34fe3d3-0ff9-4661-bc74-3a8d1b5e66bf","year":1901},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:886e2dcecfc49ff671ad9f6f9124b4f5dabbbf8ad2436eeb791b058e46888885","observation_id":"857ed5f3-c96a-4d6e-a765-002b2ca79b6a","resolution":{"observed_at":"2026-05-14T20:02:54.620589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:ff6b3cb1a4323e5719765e28ad604ef846e8038180f5f99b6582060d27ff2adf","observation_id":"5c79c660-0134-4341-b9b7-864abec704b7","resolution":{"observed_at":"2026-05-14T20:02:52.977944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.15743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"63fecd0e-9c7d-4315-9fd8-1e277c222876","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:4d2e3a741f58938744137aa0d4fb2cb0527e9ab742c2a8ae6c1f4acfb48d2aab","observation_id":"a519cee7-e1af-46a2-9c49-eb9f0864fed0","resolution":{"observed_at":"2026-05-14T20:02:53.028001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01618","doi":"10.48550/arxiv.2505.01618","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don’t be lazy: Completep enables compute-efficient deep transformers","venue":"ArXiv.org","work_id":"85f11780-ed20-4881-8d31-bb0834b58027","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:b61fe49dd1f16c1c367ac74b977c336314c8a5b1fc983c1e81f0495d7ad418fc","observation_id":"4e00b95c-2dd8-471f-a8a2-3921f7e2c625","resolution":{"observed_at":"2026-05-14T20:02:53.004359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13812","last_updated":"2024-04-09T21:01:56Z","snapshot_observed_at":"2026-07-06T15:46:10.123461Z","submitted_at":"2023-06-23T23:19:21Z","title":"Maintaining Plasticity in Deep Continual Learning","version":3},"cited_work":{"arxiv_id":"2306.13812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.13812","snapshot_observed_at":"2026-07-02T03:26:29.423429Z","title":"Fernando Hernandez-Garcia, Parash Rahman, Richard S","venue":null,"work_id":"7ff5dd29-d9a7-480e-befd-778fc7f98653","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2306.13812","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:3dcbf50f97e3918cd921e7989e4ca712f71800ea8b9e87320d7a016647273141","observation_id":"8bd0698d-2c4c-4b19-98bd-00c2ebca09a7","resolution":{"observed_at":"2026-05-14T20:02:53.011616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:80f7610eb5dfec24c67f2853bfdee4e2199908c6397a3e0276fc0ade67dd4308","observation_id":"c018810f-77f1-493e-b2f7-79b864874de0","resolution":{"observed_at":"2026-05-14T20:02:53.040706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08055","last_updated":"2023-06-13T18:22:24Z","snapshot_observed_at":"2026-07-06T15:42:14.659345Z","submitted_at":"2023-06-13T18:22:24Z","title":"Tune As You Scale: Hyperparameter Optimization For Compute Efficient Training","version":1},"cited_work":{"arxiv_id":"2306.08055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.08055","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"938498f9-1c30-4ebe-967d-84fcbf50562f","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2306.08055","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:6b519d2c40148d2ff0a89d95dd9c0ea5101059240f8a8410d796c9de950cc36b","observation_id":"039146de-b5d7-4940-b374-f3a16c2b65b2","resolution":{"observed_at":"2026-05-14T20:02:53.060870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:45:00.368940Z","title":"Filatov, J","venue":null,"work_id":"842e106c-7863-4b7a-89ed-aac75c9cab0e","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:2ff2f1f3ad375eae5a3589b43d207b59154dd7a4d94d7ce6126d46b9696202d5","observation_id":"f92ea071-a9f2-409a-9722-4847d80c5611","resolution":{"observed_at":"2026-05-14T20:02:52.996815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:8755943ec0641356cb2f58520de8f076532ec3c9cf0afa02f153734155a1ff68","observation_id":"9bfea212-151a-414c-bba6-af48498c7aa9","resolution":{"observed_at":"2026-05-14T20:02:53.080173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:6859c5d33af7c4d3a4be8d9c8e40673abfba67356ebafa0328a064b189bdf765","observation_id":"5c55f784-bd38-4abc-9629-78247574edcd","resolution":{"observed_at":"2026-05-14T20:02:53.018294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02469","last_updated":"2024-06-04T16:38:57Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T16:38:57Z","title":"Landscape-Aware Growing: The Power of a Little LAG","version":1},"cited_work":{"arxiv_id":"2406.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c8293f8e-4341-4a1b-9a06-b2b663e6b19e","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2406.02469","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:13283f97345a733ad35385b6167280273cd0ab2936d3da697b66eecfb86ee78c","observation_id":"ff14f264-26cb-40b5-9440-8c52167e737d","resolution":{"observed_at":"2026-05-14T20:02:53.086528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2510.06548 , year=","venue":null,"work_id":"6e628b1f-a1b1-451e-84ce-3a469b302154","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:65840d68730085f7425d7d793500dea2266d805c8ce8bfa9273e5ee5e9a34393","observation_id":"ae6ef9ec-3d43-4dfc-9e67-911427ac3152","resolution":{"observed_at":"2026-05-14T20:02:53.034301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10545","last_updated":"2026-07-02T03:00:57Z","snapshot_observed_at":"2026-08-03T01:08:27.344257Z","submitted_at":"2026-02-11T05:37:22Z","title":"$\\mu$pscaling small models: Principled warm starts and hyperparameter transfer","version":2},"cited_work":{"arxiv_id":"2602.10545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.10545","snapshot_observed_at":"2026-07-03T02:16:49.045063Z","title":null,"venue":null,"work_id":"38589029-87d1-4ec4-8f4b-5620d6f7f9b5","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2602.10545","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:c446761d061943902d30208ca52d08ee115fbc2e9db6f32f730a644a2df4dadd","observation_id":"d10de383-9733-4bf1-a916-3e68e1d5bdd6","resolution":{"observed_at":"2026-07-03T02:16:49.045063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mihaylov, P","venue":null,"work_id":"55ed7bb3-672b-4f62-9754-9e00ec986a61","year":2018},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:fd9c568f7aa805abcdc14b786a922819e3e874d087aeaaee71ca66d216bc6609","observation_id":"77694bcf-1c11-4ed6-b205-f317191741e4","resolution":{"observed_at":"2026-05-14T20:02:54.596060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:97e171d9a1d9d05ffe439114aeb44ec7b0367344ecc429228c801d543934c9d3","observation_id":"2e4b1609-7317-42c5-ac8d-00c81c037857","resolution":{"observed_at":"2026-05-14T20:02:53.098552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Porian, M","venue":null,"work_id":"b5e02c7f-f1b2-41fc-8069-2095db6282a0","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:016446427e8dbba0011f5a61e2e5aa9d41716a05c1688f7f71d18158c00763c1","observation_id":"f372e8cf-2faa-46e5-9a6c-cae219386f7f","resolution":{"observed_at":"2026-05-14T20:02:54.591746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13880","last_updated":"2022-04-26T10:54:24Z","snapshot_observed_at":"2026-07-06T11:13:41.697221Z","submitted_at":"2021-05-28T14:43:26Z","title":"Knowledge Inheritance for Pre-trained Language Models","version":2},"cited_work":{"arxiv_id":"2105.13880","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13880","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2105.13880 , year=","venue":null,"work_id":"795c64f3-7777-4135-bcd2-95b4d97f1416","year":2022},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2105.13880","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:b8266739599b98c8abd88a9ae1701f1e966520d61813e4ca367a0355df1be26b","observation_id":"748e86c1-48ae-40d3-8071-563a27a0fb3a","resolution":{"observed_at":"2026-05-14T20:02:53.073632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:cffca040787ced327a731809f9d4c5c43197b55423bcd368f6415caa86aa898b","observation_id":"95e7bbe6-0968-421c-86f1-41900fd61071","resolution":{"observed_at":"2026-05-14T20:02:53.054105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12903","last_updated":"2024-09-20T16:22:37Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T16:50:26Z","title":"Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization","version":2},"cited_work":{"arxiv_id":"2409.12903","doi":"10.48550/arxiv.2409.12903","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12903","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling smart: Accelerating large language model pre-training with small model initialization","venue":"arXiv (Cornell University)","work_id":"26390b69-5202-484a-bfa1-1165329220c4","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2409.12903","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:9cf5d63357c9949e9fe6420a213468211f2f4d58dd73925578613e7907188793","observation_id":"7e33514b-bed9-43ce-b9dc-93a0ccf1b66e","resolution":{"observed_at":"2026-05-14T20:02:52.958845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"67bfb98a-bc2a-4aea-97c9-0ceefd16fc4f","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:2c86f07a50915444ff89924ca2fbcdcf855493bd4cc756e8089c761f34d9f187","observation_id":"41e1fed8-4fb3-4ef0-b270-046fc059d2d4","resolution":{"observed_at":"2026-05-14T20:02:54.600050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:957df6209be6155677c8e12221405d843fc043f3c83b74922dc25fa314b718e8","observation_id":"2c524322-9ff8-46e3-8489-a20837f450fa","resolution":{"observed_at":"2026-05-14T20:02:52.964832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.00153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thérien, C","venue":null,"work_id":"9a1a9e32-28a1-4169-9707-1a3aa37cf770","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:2cfbfc08202be4b73f1691469a4e18730c0e7b8c4c037814672830cbca3b0488","observation_id":"3b246ad4-492b-48aa-8619-060e739f08a6","resolution":{"observed_at":"2026-05-14T20:02:52.984062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:f8b8d34c9fafea1e271af0963de1e922b613f71b369e8803e6301ffad9a4017d","observation_id":"7c3faa21-eb96-44fc-916c-1c97034859f2","resolution":{"observed_at":"2026-05-14T20:02:53.092487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04281","last_updated":"2026-04-05T21:47:41Z","snapshot_observed_at":"2026-07-13T10:12:39.064092Z","submitted_at":"2026-04-05T21:47:41Z","title":"Preservation Is Not Enough for Width Growth: Regime-Sensitive Selection of Dense LM Warm Starts","version":1},"cited_work":{"arxiv_id":"2604.04281","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04281","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preservation Is Not Enough for Width Growth: Regime-Sensitive Selection of Dense LM Warm Starts","venue":"cs.AI","work_id":"57743b22-4baa-44cc-b3f1-388a6e520e63","year":2026},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2604.04281","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:549aad0fc0b7dbe17faf37f96267f90ee620eb8f9eb93746e932a11b404a7f7d","observation_id":"debbe55d-f196-454e-a243-ee78a484e021","resolution":{"observed_at":"2026-05-14T20:02:53.066891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-02T01:09:26.116796Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2312.03863","doi":"10.48550/arxiv.2312.03863","metadata_source":"pith","pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Effi- cient large language models: A survey.arXiv preprint arXiv:2312.03863","venue":"cs.CL","work_id":"d859363b-b3a3-42c5-861b-b3b7776e4ff7","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:0e5fc7e2126e81aec5b3dd8aedbb7e4df2a3b7d76b7f60705d710a3e6f3a88d8","observation_id":"51e8d4f7-ff39-4b93-a88a-86c1aafbf229","resolution":{"observed_at":"2026-05-14T20:02:53.104922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:10.21899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:10.21899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02472","last_updated":"2026-06-29T15:41:30Z","snapshot_observed_at":"2026-08-03T05:27:04.791799Z","submitted_at":"2026-02-02T18:52:52Z","title":"SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning","version":2},"cited_work":{"arxiv_id":"2602.02472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.02472","snapshot_observed_at":"2026-06-30T03:18:06.134504Z","title":"SPARKLING: Balancing signal preservation and symmetry breaking for width-progressive learning","venue":null,"work_id":"3bcc0808-6118-4b54-b0b7-15b2be0c101d","year":2026},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2602.02472","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:625756d02c4b2aec0d360e6bc1f3326d2f383c77ffe8e87baa83bfd1efc0522f","observation_id":"9d8fb988-dd5a-4056-b221-c6d9a04fc9e8","resolution":{"observed_at":"2026-06-30T03:18:06.134504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This family of parameteriza- tions describes scaling factors for the weights, the learning rate, and the standard deviation of the initialization","venue":null,"work_id":"42d5b322-959a-4e3f-9716-d34db60733c9","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:3e35bf53117ac6f628d31cd2c1f76b562ec3eb38e6c7b8cb3af6e55ad6b68224","observation_id":"c16acb1a-c7f0-45c2-af20-8b04ffe883ca","resolution":{"observed_at":"2026-05-14T20:02:54.580817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"B Synthetic Regression Benchmark We use the synthetic regression benchmark in which the target function is constructed to have a power-law Fourier spectrum [Qiu et al., 2025]","venue":null,"work_id":"d65c6349-d6a7-46d7-ba4c-b2d3ae676cef","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:b77d1e8d6f782c26432fa26e58f9d059dd57011b08397d6faccec3a4f113b139","observation_id":"d32acd80-7f12-41c7-a133-35a9ee3289aa","resolution":{"observed_at":"2026-05-14T20:02:54.575901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grid Sizes.The base grid contains 8·3·5·3·2 = 720 configurations","venue":null,"work_id":"69f21117-3654-46a0-afe4-169b4ee08077","year":2048},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:41b17cd8f632b25f6f8d06a57f59a6c098dde3327d17d67c3e688eab5a108891","observation_id":"b90c003f-7ebc-49ca-a25c-8ed92a5cc03f","resolution":{"observed_at":"2026-05-14T20:02:54.587430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74b61734-5cd8-4140-9913-a5ad8ac2f82b","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:e29384e2dbb7b11b665514b61444b26ee3859f852f6f1e007ad574c06ce2be4f","observation_id":"3a46482d-97e8-4afe-838e-9c3fe9523c53","resolution":{"observed_at":"2026-05-14T20:02:54.604152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To study its sensitivity, we sweep the perturbation scale σperturb on a 32M→286M transfer, keeping the remaining SZP settings fixed","venue":null,"work_id":"bb2395f0-86b6-4330-8e62-a70eda4ee981","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:3722367518904aa898f1c7fd2fa1c660673a0bb4f484d553d96a128602309f70","observation_id":"ab4b6cea-df64-4369-a6d9-d6306c6a0549","resolution":{"observed_at":"2026-05-14T20:02:54.608501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6027a077-9899-43ac-ae08-a11cd926efd2","year":2048},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:5698dade564eb904d42098c5d110ccc9c4a973a79c4dc6c487ba09abd18aaf89","observation_id":"6e87f098-361a-4a95-9f03-faf382187222","resolution":{"observed_at":"2026-05-14T20:02:54.612694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weight Decay.All experiments usezeroweight decay","venue":null,"work_id":"a072ca44-9261-4855-9300-c334d39f7687","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:06b9ce5677f80398f03cc666595f2a97d5032b84e28708527ed61d0027445528","observation_id":"cf4664b6-c31a-47d5-aa2b-e648f41b8a4a","resolution":{"observed_at":"2026-05-14T20:02:54.617051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e1f152e4-48d3-45c9-bf9e-ff33c53d3558","year":1920},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:c51b1277482188825d546e337c2d36f241fb2bd622397a16195b74579d6aaae5","observation_id":"7ac909cf-3983-4ab1-904b-967620676fc5","resolution":{"observed_at":"2026-05-14T20:02:54.562630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For the reported language-model experiments, we report GPU-hour ranges based on the number of completed runs, hardware allocation, and typical wall-clock time per target scale","venue":null,"work_id":"4a6a70f7-d238-4061-9fce-4d36cf07e4d7","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:791c04519056fee1a9ffcb7f51cb09f70d1383f4f18d8a92f5032a607aa6f4e9","observation_id":"bb041131-db90-4501-884a-c8d60784a859","resolution":{"observed_at":"2026-05-14T20:02:54.567503Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"copy-and-rescale","venue":null,"work_id":"981e9faa-c799-4ee4-addc-06d9e3a61088","year":2016},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:56d0ffecbfe9ff7d63b099a06235cec44cd52ff93794a9ab26dfaf84cda6bbac","observation_id":"73987363-78ce-4c61-887f-1248229eae0b","resolution":{"observed_at":"2026-05-14T20:02:54.571721Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Following Approach 3 of Hoffmann et al","venue":null,"work_id":"9b00296f-1ad0-4a57-b9d1-fda9022d8878","year":2022},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:7c7f56b199a9cf3fcfce2bede2ab7907e87ce8694b7b898217da8db93118e96a","observation_id":"a0a6ed75-0ff1-49d8-bca1-ce9ae6f7050c","resolution":{"observed_at":"2026-05-14T20:02:54.559030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":23,"verified_fuzzy":9},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2605.13405."}