{"as_of":"2026-08-06T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb8f3b7afd79e6b93b16657a83a26671ca49735b4ed5f2075e830c35f2302f1a","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T08:15:20.191222Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29158/citation-record","integrity":"/paper/2606.29158/integrity","json":"/paper/2606.29158/citation-record.json","paper":"/paper/2606.29158"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19733","last_updated":"2025-08-28T11:08:05Z","snapshot_observed_at":"2026-08-05T15:35:34.698034Z","submitted_at":"2025-08-27T09:57:45Z","title":"Tune My Adam, Please!","version":2},"cited_work":{"arxiv_id":"2508.19733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19733","snapshot_observed_at":"2026-06-30T08:24:26.803537Z","title":"Tune my adam, please!arXiv preprint arXiv:2508.19733, 2025","venue":null,"work_id":"593e34af-a3f9-408e-a6fd-aef79e7e7dd6","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2508.19733","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:1f934628210193a4b29132773cfa82e415c80bbb59ac7d870014da46684b0ed9","observation_id":"1ed80a9e-47b6-467a-a23c-9d2ae7b9bb60","resolution":{"observed_at":"2026-06-30T08:24:26.805017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:da53563a6052f9888c37aefced97d584dc907ad424085886eb3f66dbfae673ff","observation_id":"b476bcbc-729f-4330-94de-9e18dd9d44db","resolution":{"observed_at":"2026-06-30T08:24:26.802509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.402309Z","title":"Power lines: Scaling laws for weight decay and batch size in llm pre-training","venue":null,"work_id":"8f9be6fa-b030-472c-ba51-f85d78055ac6","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:b2a0108377150e04a624d7952042bafc4574800b23c01abb005834d8ae3a76c6","observation_id":"2b49e810-a187-4c01-be95-494c36a627de","resolution":{"observed_at":"2026-07-10T22:27:43.419325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.439176Z","title":"Scaling optimal lr across token horizons","venue":null,"work_id":"489e87d3-d0d0-4e21-817f-2574b6c1662a","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:988255f0ae911f533eeff7a60afa350941a97e954b538f3b03554388422e6e82","observation_id":"d04d66e2-b1fe-4124-bc94-a89b80481c78","resolution":{"observed_at":"2026-07-10T22:27:43.453162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.339060Z","title":"Y., Deiseroth, B., Cruz-Salinas, A","venue":null,"work_id":"e7bd0158-fad5-4a80-96f7-c1417838344b","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:fdf781c9105abcb2ecf81960960192546e6ae4f390fb7e539b53affda2e6258c","observation_id":"2942bb31-e203-45f3-807e-d8b56bbdb2f0","resolution":{"observed_at":"2026-07-10T22:27:43.352095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.354053Z","title":"Depthwise hyperparameter transfer in residual networks: Dynamics and scaling limit","venue":null,"work_id":"5d5dba77-26fa-426b-b283-ccfa1dcd6eb1","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:68065b0083b4b63a3e49e0b248dd75fdd6a192706be01709aa1f4e17f14dda49","observation_id":"85bfd103-e0ed-4bf5-8edf-3ae048ad1712","resolution":{"observed_at":"2026-07-10T22:27:43.368176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:83f23f071249404ed6be99971398354b5585d603624bfe73544d8bcc06d3d9e7","observation_id":"326afa66-a69d-41c6-b494-96c0f9d9240f","resolution":{"observed_at":"2026-06-30T08:24:26.799840Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01618","doi":"10.48550/arxiv.2505.01618","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don’t be lazy: Completep enables compute-efficient deep transformers","venue":"ArXiv.org","work_id":"85f11780-ed20-4881-8d31-bb0834b58027","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:dae26e2b6e6cbc5f05c11cd5abcbbdf405d44ecc480d34e6e6c70d2de4d231f4","observation_id":"acdbe677-c97d-4750-a1ca-d887f791c183","resolution":{"observed_at":"2026-06-30T08:24:26.796924Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.385985Z","title":"E., Xiao, L., Wortsman, M., Alemi, A","venue":null,"work_id":"bf54c1ad-c567-4fed-8061-e1ac59766110","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:1c5a9f75ae660eba91e9aa55d33c88ae8e5b383481b8d203f034fbbd26633804","observation_id":"fad2912c-901a-4aa5-ac76-44710a4a7a07","resolution":{"observed_at":"2026-07-10T22:27:43.399756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:48:20.864382Z","title":"Robust layerwise scaling rules by proper weight decay tuning","venue":null,"work_id":"c2a324e5-7a18-4210-a157-63d0c409278a","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:43d8f8b4c8640a0f9ced0cfadd5596f1a72cd2edd936b97ac9a575e82bb5dd59","observation_id":"8cfee3b9-eef0-4808-9210-cc8a42fb94df","resolution":{"observed_at":"2026-06-30T08:24:26.782528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.323585Z","title":"Nemotron-flash: Towards latency-optimal hybrid small language models","venue":null,"work_id":"389ab6b1-76bb-436b-bcc6-bb525cb884db","year":null},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:2e8f0286cd046934c40127ddf48e7b997bf16724d43d15e63079418f7c53a5e9","observation_id":"d5ba71d2-ef7d-4300-a530-e599984dba5b","resolution":{"observed_at":"2026-07-10T22:27:43.337043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.278005Z","title":"Norm matters: efficient and accurate normalization schemes in deep networks.Advances in Neural Information Processing Systems, 31, 2018","venue":null,"work_id":"f53ca376-11b2-42e3-87d5-7e73c02a434b","year":2018},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:3b088bf8561c5a80abbb5c5baf2e90fab388636f61d68505581448532b0bbb0b","observation_id":"5e5b1cde-973b-4d68-9a8f-4bef60ff7942","resolution":{"observed_at":"2026-07-10T22:27:43.292267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.260331Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":"9cd01a6f-ab02-4691-bda1-170fb6295341","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:0a946e63546f6a546ed4692a1f58782a64af6a08000d49583a750ebe73ccdaee","observation_id":"b6e36f17-a54f-4e53-a522-bcbc3966accc","resolution":{"observed_at":"2026-07-10T22:27:43.275959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.294190Z","title":"H., and Leyton-Brown, K","venue":null,"work_id":"b84fdb85-024f-4af2-8132-9d91ee3b1ef9","year":2011},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:5815cab8a8db6d71064b9d5f77d592740d498b59466888bb5b49c647b417daf2","observation_id":"b9fc8db1-5b25-45c6-b8e5-5912fbd4607b","resolution":{"observed_at":"2026-07-10T22:27:43.307151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.309070Z","title":"and Szegedy, C","venue":null,"work_id":"a5c528d8-3eca-4296-89e8-a244eaa3766e","year":2015},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:e2179f5cef959a9c5dbe607e536885c224123e71b4914dfd65ae462a375df3d8","observation_id":"216b8889-4b67-4bab-a95b-9f06bbd1caa0","resolution":{"observed_at":"2026-07-10T22:27:43.321669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04623","last_updated":"2018-09-13T09:29:55Z","snapshot_observed_at":"2026-07-06T06:09:11.794595Z","submitted_at":"2017-11-13T15:11:56Z","title":"Three Factors Influencing Minima in SGD","version":3},"cited_work":{"arxiv_id":"1711.04623","doi":"10.48550/arxiv.1711.04623","metadata_source":"pith","pith_arxiv_id":"1711.04623","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Three Factors Influencing Minima in SGD","venue":"cs.LG","work_id":"bcb52129-9115-4696-8926-64f96214f2d7","year":2017},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/1711.04623","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:de801c8bc15fd3d61a0a568595fe31816f20f3282b0357527355f28d2dd0850c","observation_id":"f1ed5e63-8183-4b39-9fb3-943fbbad2508","resolution":{"observed_at":"2026-06-30T08:24:26.785633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:081c3de52631c70592572e935273c79344eca4537795113adbcaddda6e7ec5d2","observation_id":"b2d893dc-ba19-47b2-9599-720bda639dba","resolution":{"observed_at":"2026-06-30T08:24:26.788145Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.370052Z","title":"nanoGPT.https://github.com/karpathy/nanoGPT, 2022","venue":null,"work_id":"1ced321b-d86d-4cd5-8971-2f47dcfe7197","year":2022},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:e585566a8c27f761aa24512b4d393b026de8df74fc52688ddcad0afe402a8427","observation_id":"93482c5a-9c43-43d1-8828-1011787364a5","resolution":{"observed_at":"2026-07-10T22:27:43.383752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.421767Z","title":"Rotational equilibrium: How weight decay balances learning across neural networks","venue":null,"work_id":"b50554e1-8fc3-4b66-abef-547b80f54a3f","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:72f7018490893f23debe225900d9ce18dd1ceea584cc20d2f5274967f104ea0b","observation_id":"70994301-6fd4-488d-9b4b-cb94d4fd16c2","resolution":{"observed_at":"2026-07-10T22:27:43.437186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.681509Z","title":"Weight decay may matter more than mup for learning rate transfer in practice","venue":null,"work_id":"772fce09-8b6d-44b1-9d43-b07a17b3abf5","year":2026},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:4831cbb18d0ae14b289ebacd603306a89b5514dff6a9bd3551a002a0dd385824","observation_id":"1d47b165-16e1-4c2f-b048-95fcb2473e01","resolution":{"observed_at":"2026-06-30T08:24:26.791192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T08:24:26.770537Z","title":"Efficient hyperparameter tuning via trajectory invariance principle.arXiv preprint arXiv:2509.25049, 2025","venue":null,"work_id":"8e6219dd-2b3f-4c9b-bc35-10bc43669cf5","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:a037d8f7e749435bb13098ab26718d3b11c6c998b738473197bd514eebb780da","observation_id":"9b8a732c-2eb5-45f3-af9d-0924c8286b4f","resolution":{"observed_at":"2026-06-30T08:24:26.772306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":"ArXiv.org","work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:fb0ea126437c99f6a1f7e1ac0abdd70f8185991dc586d8ab62f4977a7c177a53","observation_id":"23542f01-bb32-401a-9b90-90b1e45102bb","resolution":{"observed_at":"2026-06-30T08:24:26.775578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.455273Z","title":"Reconciling modern deep learning with traditional optimization analyses: The intrinsic learning rate.Advances in Neural Information Processing Systems, 33: 14544–14555, 2020","venue":null,"work_id":"77b4ebe8-0a8f-4011-ac7c-c422e93c6baf","year":2020},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:ab73539783512643ea6a1bb7a4dfd38390273053a743bfb7913e6cd900eb0b1e","observation_id":"910d5cd0-ae41-426c-805e-22c39419f4f0","resolution":{"observed_at":"2026-07-10T22:27:43.470216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:bcb87af04546a97913eb19ae5972441b361a0a6efef90d3a8c624687cb985dd7","observation_id":"fc444885-f740-4f4d-bc3f-7df9c1d70f0a","resolution":{"observed_at":"2026-06-30T08:24:26.786545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.164075Z","title":"and Hutter, F","venue":null,"work_id":"fcf2f64b-137f-4b82-95e6-5db1a710e16b","year":2019},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:82c2f9277106f61553a1fd35077591cd0baf9b49cdf44a3cb372d98eaef62152","observation_id":"d7dd65cb-4a23-4d67-83b9-227a7d2daab7","resolution":{"observed_at":"2026-07-10T22:27:43.177327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.179554Z","title":"ngpt: Normalized transformer with representation learning on the hypersphere","venue":null,"work_id":"390ba57f-f861-4506-bd50-0859780595d2","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:6ace5e263ddb2cadf8be7cf7d76f3e06dd05d793f55ce2c7bf74da37309ece35","observation_id":"f04a8424-4645-408b-a2fd-edd22af09e6b","resolution":{"observed_at":"2026-07-10T22:27:43.193385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.195575Z","title":"A multi-power law for loss curve prediction across learning rate schedules","venue":null,"work_id":"04d82cef-90c8-4e6d-bcec-356948c111f5","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:e5a8937c7c97e586df5dbaec79552a1a1447973e2fc1dc9293ccab249f27e708","observation_id":"fb782221-1cd1-4f28-9fa5-ed58f30af273","resolution":{"observed_at":"2026-07-10T22:27:43.209774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.227858Z","title":"On the sdes and scaling rules for adaptive gradient algorithms.Advances in Neural Information Processing Systems, 35:7697–7711, 2022","venue":null,"work_id":"b93cab61-f77d-43a1-b5a0-76201cdcbd22","year":2022},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:9189520cbc81c224913b13733a43af982f85a94638d3f547c326b534fde71c78","observation_id":"7336a97c-5837-4d9d-832f-2fce3e899626","resolution":{"observed_at":"2026-07-10T22:27:43.241692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.148855Z","title":"G., and Goldblum, M","venue":null,"work_id":"43e58964-c5ed-48f0-891f-c27a7425f929","year":null},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:b24f55dc1aaa8d2eb7b58515bbf018ed38a71f3bbb6649268acb95e1b795c654","observation_id":"70b8bbfd-6f20-459a-b87b-080c0bc99d32","resolution":{"observed_at":"2026-07-10T22:27:43.161987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":"1812.06162","doi":"10.48550/arxiv.1812.06162","metadata_source":"pith","pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Empirical Model of Large-Batch Training","venue":"cs.LG","work_id":"f3989b96-1ee9-403f-a0e2-0342ac16bcb7","year":2018},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:5b918c2efe91616d8349947e072b239494e6362c33e6c3d026ce9344e76463d2","observation_id":"6c3812b3-5e75-4cf6-8c25-6dd533c7b0c2","resolution":{"observed_at":"2026-06-30T08:24:26.769946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22382","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.819976Z","title":"Completed hyperparameter transfer across modules, width, depth, batch and duration","venue":null,"work_id":"af8e9253-b26d-49cb-8490-847fab342f99","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:6a6806999b428c79824a95c140ef618b3a61a1c4419df2338fcd491d88b53a6f","observation_id":"8d1dc6d3-028a-4b07-aa18-9ce07405935b","resolution":{"observed_at":"2026-06-30T08:24:26.772683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.243729Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale.Advances in Neural Information Processing Systems, 37:30811–30849, 2024","venue":null,"work_id":"a2a94cdc-2a36-4643-84b3-c4c17f94be8f","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:dcb01ce2f4e40b5fc5b595edeaf06aba806f2358d18bac121a89501014f0745a","observation_id":"f0dc6fca-e4f4-49b3-be1a-e3b4f7e87669","resolution":{"observed_at":"2026-07-10T22:27:43.258185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19146","last_updated":"2025-01-19T10:34:08Z","snapshot_observed_at":"2026-07-06T18:37:55.945869Z","submitted_at":"2024-06-27T13:02:43Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","version":4},"cited_work":{"arxiv_id":"2406.19146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.19146","snapshot_observed_at":"2026-06-30T08:24:26.777027Z","title":"Resolving discrepancies in compute-optimal scaling of language models","venue":null,"work_id":"651c4663-eeef-4500-9585-de00f9300854","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2406.19146","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:ee71afded0c060daec47b612a63674248de6c2cec1ec543e52ef5a0885900766","observation_id":"70f0f246-979c-4d3a-9506-8d9675bd2dab","resolution":{"observed_at":"2026-06-30T08:24:26.779384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.211828Z","title":"Language models are un- supervised multitask learners","venue":null,"work_id":"7617d8ca-b5b3-4a29-8197-dd19c23a2660","year":2019},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:d278c6e1dd6af3bc2b7fb9338c000d920aa190690d29de4ae0d9c474dbe3cd4e","observation_id":"a7ae3b72-9161-42ae-9408-24e534c7285f","resolution":{"observed_at":"2026-07-10T22:27:43.226047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.134525Z","title":null,"venue":null,"work_id":"1ac895d1-c6cf-410c-be31-0015af0c54b7","year":2012},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:fb5c307bfc62796733878c5367c29048bf3cb80c78e4cf67a0361d57b3b7a294","observation_id":"87995147-01b3-4849-ad29-b17493b54b62","resolution":{"observed_at":"2026-07-10T22:27:43.146959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-07-06T19:03:35.394180Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":"2408.11029","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-06-30T08:24:26.792264Z","title":"Scaling law with learning rate annealing.arXiv preprint arXiv:2408.11029, 2024","venue":null,"work_id":"30a83e93-31c0-4306-9016-0862486adbbd","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:7be90aa2b199ec50947e2d8654c6988df01322c2026eb4645692c4f0fabbeb5f","observation_id":"068cd734-0431-4fcc-8a9b-977367f48ca5","resolution":{"observed_at":"2026-06-30T08:24:26.793968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05350","last_updated":"2017-06-16T17:08:08Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T17:08:08Z","title":"L2 Regularization versus Batch and Weight Normalization","version":1},"cited_work":{"arxiv_id":"1706.05350","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.05350","snapshot_observed_at":"2026-07-04T20:30:07.604801Z","title":"L2 Regularization versus Batch and Weight Normalization","venue":"cs.LG","work_id":"17e14df7-cc67-4fa7-b09c-4bc22ea9e76a","year":2017},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/1706.05350","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:ed267f96ca14cf1f4aa821d9279f1e1cfc8347e482bfd2521121272bfc4ca818","observation_id":"1b0bb89b-2852-45b5-8e8c-2359a173e3d5","resolution":{"observed_at":"2026-06-30T08:24:26.807479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.020875Z","title":"N., Kaiser, L","venue":null,"work_id":"53d958c8-a6ff-4e5e-9a94-6b0d820e2364","year":2017},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:7b0372fc00d9e7139992088370a7b21f064523bfdc2e8c67363546da54cc003b","observation_id":"ec48e0a1-bd5e-4a9c-b52e-9034a6388842","resolution":{"observed_at":"2026-07-10T22:27:43.033764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.071232Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training","venue":null,"work_id":"af4b3f3a-264c-48c6-b54c-a7db7fd73562","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:1bdbcddefba4873589e0bfda6c6d04c0a83bbe9b99ee9c8e58ed40bc79787a0b","observation_id":"0b715f71-b032-424c-bf81-edaac5d03c5b","resolution":{"observed_at":"2026-07-10T22:27:43.087074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.319","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling laws across model architectures: A comparative analysis of dense and M o E models in large language models","venue":null,"work_id":"204b3bc1-6b41-4e65-9e43-f9a45952dc53","year":2024},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:a9d4bc7b750e027359b82876f36d1dad8f7b49f0ad321581b314dcf0e40fcfac","observation_id":"81f308be-1414-4f09-97d9-38b1fe3beed7","resolution":{"observed_at":"2026-06-30T08:24:26.153118Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.005879Z","title":"and Aitchison, L","venue":null,"work_id":"1b0b3158-b3e2-4ab1-8300-f7b8ebfc6da3","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:dd1d99d9e3d0ea890cc38dd70d6f7e4382faf3603058d2b35bc2d29819e98496","observation_id":"14de7d54-e1a2-439f-a978-41d89baa9892","resolution":{"observed_at":"2026-07-10T22:27:43.018928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.091129Z","title":"Fantastic pretraining optimizers and where to find them 2.1: Hyperball optimization, 12 2025","venue":null,"work_id":"9b0e70a8-a83e-43c5-a75d-25a0e8b78e55","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:0e2e91d3b664b8c02e905036cfa3e75d8f371421b8e21e1ee6fea1c83bb9ce24","observation_id":"d5b9adb0-4a9f-418d-bc2e-5ad7c3c40901","resolution":{"observed_at":"2026-07-10T22:27:43.117232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.779389Z","title":"Controlled llm training on spectral sphere","venue":null,"work_id":"69f692bf-c6bb-45da-9428-f2f0a648156c","year":2026},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:1d62030a411f5da9d56c359a383cd49e831237d4c6f7cad60ad99955aec79541","observation_id":"ed70c51b-7dd4-42f4-9e0f-e43c287b5ac2","resolution":{"observed_at":"2026-06-30T08:24:26.775149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.035779Z","title":"and Hu, E","venue":null,"work_id":"ca724898-7a42-4d6a-bd84-bc172b46e709","year":2021},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:f69d0a299af392118a02a1ebc6bceb670ca97f09ad0ed41ebc57fcfadcdcc9c4","observation_id":"ac30bcd1-4fd1-4bdd-b1f5-2cddd2272537","resolution":{"observed_at":"2026-07-10T22:27:43.051503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.054121Z","title":"Tuning large neural networks via zero-shot hyperparameter transfer.Advances in Neural Information Processing Systems, 34:17084–17097, 2021","venue":null,"work_id":"390088c9-77ab-4447-a538-53bb9eed583b","year":2021},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:6db91aabc96f28309ac5a7526c8de3f3631ce888413643b7ec3273b58139694e","observation_id":"31917e82-803b-4c49-8f4a-7a98ccdc03d2","resolution":{"observed_at":"2026-07-10T22:27:43.069067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:27:43.119398Z","title":null,"venue":null,"work_id":"7b10245c-34a9-4096-84ee-b67ad8034234","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:53d0b6b403a86ab28f7dcaf5de79753a5d054d24262c4c3a47e14681f45bda88","observation_id":"46be5cf6-44e2-4b78-b138-60d16ba37af6","resolution":{"observed_at":"2026-07-10T22:27:43.132477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:57.579765Z","title":"arXiv , author =:2602.10300 , file =","venue":null,"work_id":"1a6654c7-9705-4637-acf0-cabb32b3fc0c","year":2026},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:aeeb0d54de26e594c1b9f9bdf4be2131b42509f3c91b4955d793c6c78cef99ac","observation_id":"fbcbe078-632d-4549-a4b2-31dae2eaa7de","resolution":{"observed_at":"2026-06-30T08:24:26.784084Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T08:24:26.756350Z","title":"How to set the learning rate for large-scale pre-training?arXiv preprint arXiv:2601.05049, 2026","venue":null,"work_id":"936dd45c-55f2-4932-924e-01e1274527f5","year":2026},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:688025e2e29d04c6f8aca8227ac2d029c50b0c7598ffdeab08fdea995dd9599f","observation_id":"1e8e661a-dcd3-42cf-8e8d-9ce6fdbf9989","resolution":{"observed_at":"2026-06-30T08:24:26.758109Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":2,"verified_exact":14,"verified_fuzzy":26},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2606.29158."}