{"as_of":"2026-08-23T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60d3aedd44f37a7cd700efc801846f84efff5631674f846e79815724fe6c40a3","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T12:53:41.205912Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23777/citation-record","integrity":"/paper/2607.23777/integrity","json":"/paper/2607.23777/citation-record.json","paper":"/paper/2607.23777"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.043061Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.043061Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:c10adf1cbfde0d0d58d85a076f11c60cbee40ac9e0dc08c31fdffbb5779a2d0b","observation_id":"779190fd-96e4-45cc-b818-7c5e72291d75","resolution":{"observed_at":"2026-07-30T12:53:40.043061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-30T12:53:40.226740Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.226740Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:789765bd8f3d6b0822cbec545faa296d5040d8fcf13a4b390f9c74a7d1941af3","observation_id":"276f9969-64b7-42fd-9f5b-83ec6d6a3308","resolution":{"observed_at":"2026-07-30T12:53:40.226740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-30T12:53:40.363542Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.363542Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:32c0e6c9f6f0e195e99695d8a4ce8490c6cead031c6a6aef8b48648927648e53","observation_id":"1ec2ef78-4e4b-4ff2-8dd9-ac917bbf00f5","resolution":{"observed_at":"2026-07-30T12:53:40.363542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.488793Z","title":"Explaining neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.488793Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:8cddd476b770b7e1d355c160b461a827eeb0e47ec653bffa0a9b065e22c6975c","observation_id":"a77a1adf-f488-4b0f-83a5-4a20f16a1d13","resolution":{"observed_at":"2026-07-30T12:53:40.488793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-30T12:53:40.597117Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.597117Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:a93a0447cc102037bb7dde008e656ea7f61a6a0ff3e481bb7be1a12583c7448a","observation_id":"7cf1cc50-7468-421f-aad3-e21fb22704e6","resolution":{"observed_at":"2026-07-30T12:53:40.597117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-22T02:54:03.990193Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-07-30T12:53:40.706869Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.706869Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:724c36543619a5d813699c263b820e8e88571e0cc4126195003ef2066085f539","observation_id":"55b13f6c-2c76-4e87-b39a-92a8567d0e1e","resolution":{"observed_at":"2026-07-30T12:53:40.706869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.797871Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.797871Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:597f83cfd9219c4b1f78f1be0cabdb128f2bdb45e324f3f0ed4b921701495769","observation_id":"4fd4085d-e984-4019-ab2c-1d6c49ae3d4c","resolution":{"observed_at":"2026-07-30T12:53:40.797871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14005","last_updated":"2025-01-25T00:38:28Z","snapshot_observed_at":"2026-08-16T13:50:28.206249Z","submitted_at":"2024-05-22T21:22:44Z","title":"Neural Scaling Laws in Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14005","snapshot_observed_at":"2026-07-30T12:53:40.884696Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.884696Z"},"links":{"cited_paper":"/paper/2405.14005","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:b2de6d1d10edecef9a75b5f62201302dc3bdafecfbd025d81293e76175bd5fa9","observation_id":"8e874d25-fdcd-44f7-8324-a1de5c0199b4","resolution":{"observed_at":"2026-07-30T12:53:40.884696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-30T12:53:40.891094Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.891094Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:102b39a33a034b9e977dce6b0c2c0872c6d5e1e30bcc77d69436ea7025e6c1fc","observation_id":"11f0e4a3-670c-453c-8ddd-786047876460","resolution":{"observed_at":"2026-07-30T12:53:40.891094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-08-11T03:34:09.767397Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-07-30T12:53:40.895797Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.895797Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:ff29265e1eefb64431768df418a35a6e385f4fe505a4c0db6204d2d93cb3238d","observation_id":"ccc70d7e-a03d-487c-8525-aa737e8f1e96","resolution":{"observed_at":"2026-07-30T12:53:40.895797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.900324Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.900324Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:b2d4ff5f7c052fa26b54173942775f6c77e610c594c79db9eee8c61c8ef6d591","observation_id":"d353d982-f150-4baa-9ad5-6b6b537de4e2","resolution":{"observed_at":"2026-07-30T12:53:40.900324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.905115Z","title":"A Simple Weight Decay Can Improve Generalization","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.905115Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:791e5360dda888b7aaeb6df1613018cdb643fd212756e042f4782a232e94e478","observation_id":"0669252d-c402-42c7-bd53-32a758d5c53c","resolution":{"observed_at":"2026-07-30T12:53:40.905115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04415","last_updated":"2024-11-04T23:21:13Z","snapshot_observed_at":"2026-08-16T14:54:23.946355Z","submitted_at":"2023-10-06T17:58:21Z","title":"Why Do We Need Weight Decay in Modern Deep Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04415","snapshot_observed_at":"2026-07-30T12:53:40.909600Z","title":"arXiv: 2310.04415 [cs.LG].url:https://arxiv.org/abs/2310.04415","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.909600Z"},"links":{"cited_paper":"/paper/2310.04415","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:1256193f4d34b9c9275a24298b97b6785bc647fdd01533cfd75caef7d642fe21","observation_id":"b48b4df0-84dc-45e0-8e09-424743d8b37b","resolution":{"observed_at":"2026-07-30T12:53:40.909600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-30T12:53:40.915205Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.915205Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:137ee8abe2375a6cab16910e53a95133c92b0d2677573ac8e107dc0ce73a6b36","observation_id":"2cfdcf2d-ac1d-4ba0-9c3e-9e5461e0649c","resolution":{"observed_at":"2026-07-30T12:53:40.915205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09405","last_updated":"2024-11-01T18:16:03Z","snapshot_observed_at":"2026-08-16T13:43:12.940315Z","submitted_at":"2024-06-13T17:59:35Z","title":"Why Warmup the Learning Rate? Underlying Mechanisms and Improvements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09405","snapshot_observed_at":"2026-07-30T12:53:40.920881Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.920881Z"},"links":{"cited_paper":"/paper/2406.09405","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:efd14f641013d8a9dfca0e2fede160ced4a26c57504640a98ffdae6290d0a5d4","observation_id":"9737d18c-75bd-4ee0-bc67-7445f196d449","resolution":{"observed_at":"2026-07-30T12:53:40.920881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-07-30T12:53:40.926826Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.926826Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:8d9dd9f697a8fe4e169b01f740853e539a7b72213534503d8692e58647d53dff","observation_id":"278735a2-2063-4ab2-9f53-c192fd02a7ac","resolution":{"observed_at":"2026-07-30T12:53:40.926826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.930943Z","title":"2024.url:https : //kellerjordan.github.io/posts/muon/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.930943Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:9cb37090c10d00ea26575f591807c7acdba8955790e753fcd7f968752040b1d1","observation_id":"03e11547-df7e-45e9-961d-a968c1cc15e5","resolution":{"observed_at":"2026-07-30T12:53:40.930943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-16T22:48:15.725816Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-07-30T12:53:40.936018Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.936018Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:08d90a90d5f025d8861056eef01dda0671f1d9e165de364877e5a3fc3a142ddb","observation_id":"8a26d2d7-3548-4363-826a-20840195459d","resolution":{"observed_at":"2026-07-30T12:53:40.936018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.940143Z","title":"A Stochastic Approximation Method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.940143Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:c90c1ad6e5ce8b729b38ef44e4666c8fd0ead1a622db3d7a375655e2871d9578","observation_id":"3cd153e1-72dc-4c18-94d5-1872b22e2f1e","resolution":{"observed_at":"2026-07-30T12:53:40.940143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-30T12:53:40.946548Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.946548Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:e0f8c30750ee09fb8500fcf347e134787302c837c5c9a81acfae93dc9ce81ad6","observation_id":"5e669c20-a196-457f-8b62-74c44e0c2476","resolution":{"observed_at":"2026-07-30T12:53:40.946548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-14T22:45:56.335948Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-07-30T12:53:40.950533Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.950533Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:f24fd97eadaf5fbd81645e26c9ec57637459aba78a7507c60a14a0db350f7912","observation_id":"18742985-3239-465c-a100-fa1b65c49831","resolution":{"observed_at":"2026-07-30T12:53:40.950533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-22T17:07:46.946476Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-07-30T12:53:40.954445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.954445Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:9c55c0329d67dc188f0ad3cc769c0270f9570ecfb317a4cc86fea8797b9f6bc8","observation_id":"cf743017-35ec-4b6e-a066-38f82f0bb173","resolution":{"observed_at":"2026-07-30T12:53:40.954445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09568","last_updated":"2018-03-02T00:12:58Z","snapshot_observed_at":"2026-08-14T19:41:57.164240Z","submitted_at":"2018-02-26T19:36:41Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09568","snapshot_observed_at":"2026-07-30T12:53:40.959117Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.959117Z"},"links":{"cited_paper":"/paper/1802.09568","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:7666c588e081627615eeb71349f3bff4ab07d2719f03c520209f9e90ca074f71","observation_id":"875cf34d-83ba-4843-8eb2-c3b3de5b968c","resolution":{"observed_at":"2026-07-30T12:53:40.959117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-20T11:15:02.831518Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-07-30T12:53:40.963582Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.963582Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:0e717dbff4edf839d95980cbde455286a10f6c4246d88733fba8cf0fbb459dad","observation_id":"142487d7-9078-4488-8392-681cf80f7dc5","resolution":{"observed_at":"2026-07-30T12:53:40.963582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-07-30T12:53:40.967581Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.967581Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:2c94619a5183a912a438dc53f1d5696bd4f0463d4c54504f7be1b6d80c48e550","observation_id":"fb89b922-ff20-4ccf-be67-3ca20a3dccef","resolution":{"observed_at":"2026-07-30T12:53:40.967581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27715","last_updated":"2026-06-26T04:47:37Z","snapshot_observed_at":"2026-08-14T15:06:21.005991Z","submitted_at":"2026-06-26T04:47:37Z","title":"Aurora: A Leverage-Aware Spectral Optimizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27715","snapshot_observed_at":"2026-07-30T12:53:40.971261Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.971261Z"},"links":{"cited_paper":"/paper/2606.27715","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:07fc2e4c48f3ee97e7bf92b6d820ddf6f9908a10acafca648f50e5328c211fab","observation_id":"98613942-ad1f-44a9-9718-ed96c96bd207","resolution":{"observed_at":"2026-07-30T12:53:40.971261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.975269Z","title":"Dion: Distributed Orthonormalized Updates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.975269Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:c859d8b2272fd2a85cce810a70230f0a2a70ccef2058074c0e7c8fa7eadbf80f","observation_id":"ffc2807d-03c3-4f46-9f86-c9d5212623e6","resolution":{"observed_at":"2026-07-30T12:53:40.975269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.978836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.978836Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:49ed7a6b0080b09b14e4c58e4cb683cf456863c38590ddeeb1de34cfa602e7b1","observation_id":"483bd6a9-0653-4ad7-8ffd-2b40df48d89f","resolution":{"observed_at":"2026-07-30T12:53:40.978836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16932","last_updated":"2026-05-04T23:23:45Z","snapshot_observed_at":"2026-08-14T07:16:28.974722Z","submitted_at":"2025-05-22T17:23:14Z","title":"The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16932","snapshot_observed_at":"2026-07-30T12:53:40.986961Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.986961Z"},"links":{"cited_paper":"/paper/2505.16932","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:d0c43965ac8ccbfcc2d0d8de8a22552b377e8be71cf90e7a1d031dfe4bdec061","observation_id":"c9973faa-5435-47d3-a70a-ed5cc56f6bac","resolution":{"observed_at":"2026-07-30T12:53:40.986961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-18T22:31:32.273634Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23061","snapshot_observed_at":"2026-07-30T12:53:40.992720Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.992720Z"},"links":{"cited_paper":"/paper/2605.23061","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:1e430da1729f16bfc92166b38f6b4d10c1c5dc57f3969ed82a6b614edbf6bf8e","observation_id":"911aa333-4fbd-400d-93a8-4a6c81f74004","resolution":{"observed_at":"2026-07-30T12:53:40.992720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.997411Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.997411Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:f1e1bb0df130614a1cb8384142b49deb52e28d5d20ecaa5ed898089e1a7c0eea","observation_id":"2c7fb9f6-0bcf-42ec-be46-d5395a69548d","resolution":{"observed_at":"2026-07-30T12:53:40.997411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09967","last_updated":"2026-06-05T21:42:21Z","snapshot_observed_at":"2026-08-15T00:27:40.443257Z","submitted_at":"2026-04-11T00:27:40Z","title":"Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09967","snapshot_observed_at":"2026-07-30T12:53:41.001602Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.001602Z"},"links":{"cited_paper":"/paper/2604.09967","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:df89ebbcba4af374e72d9ca8c54d39f3824711f36de44e70a17f1e11ddfef012","observation_id":"43073ace-70a4-47b1-8997-4d7465993ec2","resolution":{"observed_at":"2026-07-30T12:53:41.001602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.006795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.006795Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:c23a4ad623a6ba5d1b7a1dcf5d000830ad623a3d291f552ca05a0fe591eb5207","observation_id":"a23e4123-d953-48da-9821-295eba574a0c","resolution":{"observed_at":"2026-07-30T12:53:41.006795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.012922Z","title":"Optimization Methods for Large-Scale Machine Learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.012922Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:20c0e93a6890279d493f39fb1be4ebcbdde499c3f392d4a747dfc7b1619ffd82","observation_id":"92e69bab-9d3e-4f8c-b25c-0c5f98a6dd57","resolution":{"observed_at":"2026-07-30T12:53:41.012922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10797","last_updated":"2026-05-11T16:26:06Z","snapshot_observed_at":"2026-08-14T08:46:50.662308Z","submitted_at":"2026-05-11T16:26:06Z","title":"Muown: Row-Norm Control for Muon Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10797","snapshot_observed_at":"2026-07-30T12:53:41.017797Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.017797Z"},"links":{"cited_paper":"/paper/2605.10797","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:f5f9134e9ddbdf7093ee17b1bb1a6de126277b078515e38e4a5c128efb22dcfa","observation_id":"e04770ed-0bf2-400d-aa57-03816929c724","resolution":{"observed_at":"2026-07-30T12:53:41.017797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01598","last_updated":"2026-06-08T02:38:54Z","snapshot_observed_at":"2026-08-16T23:33:31.313167Z","submitted_at":"2025-07-02T11:03:13Z","title":"Convergence Bound and Critical Batch Size of Muon Optimizer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01598","snapshot_observed_at":"2026-07-30T12:53:41.022151Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.022151Z"},"links":{"cited_paper":"/paper/2507.01598","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:17a2717bf686a2eedfbf19303176fa731d30f1db53f4bd8f859168c479a0a1fc","observation_id":"cc72e5ca-0af6-449e-8e6a-a644cf546291","resolution":{"observed_at":"2026-07-30T12:53:41.022151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-17T04:14:11.630903Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-07-30T12:53:41.026143Z","title":"On the Convergence Analysis of Muon","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.026143Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:5efacb268b8134baf95eb37a6fd77cc2120db64a2d736fe90f56574008658b5b","observation_id":"9df2c4f6-02af-4a7c-bc0a-45ede472414b","resolution":{"observed_at":"2026-07-30T12:53:41.026143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-08-18T20:56:42.898921Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.15816","snapshot_observed_at":"2026-07-30T12:53:41.030100Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.030100Z"},"links":{"cited_paper":"/paper/2509.15816","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:75d28e4d0cac193a7b25b88030c9b4b1d330271dbd00bfdd153b52f6092a8df6","observation_id":"e5627a78-50d9-4101-929b-57ece23b4f20","resolution":{"observed_at":"2026-07-30T12:53:41.030100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.034235Z","title":"Language Models are Unsupervised Multitask Learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.034235Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:d5a8ca37c4c6f6755cfa6580447b11f6f25a0309a4ad3fe32ba2b3cbc7a08981","observation_id":"3155f39f-83fc-4fd8-9db8-fd674e0bf77f","resolution":{"observed_at":"2026-07-30T12:53:41.034235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-30T12:53:41.037795Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.037795Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:670db6f6945abb27a1864a8c97ed5997d7666b034c12857fe12ef0b7aa58a1e0","observation_id":"fd28eaa8-3601-43c0-8170-5269eafe5a5a","resolution":{"observed_at":"2026-07-30T12:53:41.037795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-16T17:16:25.053180Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-07-30T12:53:41.041793Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.041793Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:ead1242917d5533546f75a653e43eb9470730448519ae6a739fb7235964dc20c","observation_id":"38cbf6cf-6290-4515-aa64-80b98712a8be","resolution":{"observed_at":"2026-07-30T12:53:41.041793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.045322Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.045322Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:fe3b4234645085e83194f58b358362e573483788278d7312edbd5c6bf7a7546c","observation_id":"0a31867d-ee51-4a9c-a149-e080d835209c","resolution":{"observed_at":"2026-07-30T12:53:41.045322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19913","last_updated":"2025-02-24T02:55:34Z","snapshot_observed_at":"2026-08-16T13:14:17.535562Z","submitted_at":"2024-09-30T03:32:02Z","title":"Scaling Optimal LR Across Token Horizons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19913","snapshot_observed_at":"2026-07-30T12:53:41.048646Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.048646Z"},"links":{"cited_paper":"/paper/2409.19913","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:4cb60c2e72671fb3599ef566cb3a88116e2c1d8125ee3013273c1942e9920602","observation_id":"db4d0e64-30a4-4959-871d-4543df27f422","resolution":{"observed_at":"2026-07-30T12:53:41.048646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05350","last_updated":"2017-06-16T17:08:08Z","snapshot_observed_at":"2026-08-16T22:00:20.852295Z","submitted_at":"2017-06-16T17:08:08Z","title":"L2 Regularization versus Batch and Weight Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05350","snapshot_observed_at":"2026-07-30T12:53:41.060313Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.060313Z"},"links":{"cited_paper":"/paper/1706.05350","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:2b9639167913ab7aa06b2a7aabf0ad1fda1216a4896d8fd165dfe35e2c16a2d3","observation_id":"b4c0e474-cbe7-43f0-8789-3ee316ab8a79","resolution":{"observed_at":"2026-07-30T12:53:41.060313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17212","last_updated":"2024-06-03T15:57:47Z","snapshot_observed_at":"2026-08-16T15:29:11.414233Z","submitted_at":"2023-05-26T19:14:01Z","title":"Rotational Equilibrium: How Weight Decay Balances Learning Across Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17212","snapshot_observed_at":"2026-07-30T12:53:41.065516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.065516Z"},"links":{"cited_paper":"/paper/2305.17212","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:257646468f5be335ab66cb9c6300fd07f213707c07233711074feb3cca633c66","observation_id":"08e3f009-f43f-49fc-aaa1-048424f4be36","resolution":{"observed_at":"2026-07-30T12:53:41.065516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.070299Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.070299Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:ddae940a037a5df54297f60aa2f89e8d2058d02539be10ed6b4c95430e7fa899","observation_id":"98bd111d-c63b-49d3-bf56-722ec3e78ec2","resolution":{"observed_at":"2026-07-30T12:53:41.070299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.074979Z","title":"2022.url: https://openreview.net/forum?id=J7V_4aauV6B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.074979Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:aab723ab67ea2d99bde790f7225ba9996cb0bf378f69ded41773db201565b543","observation_id":"3a7f9e62-8d0b-4e5d-b464-af15068857ed","resolution":{"observed_at":"2026-07-30T12:53:41.074979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.079462Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.079462Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:4c2acd338b7777cf6559862913882ae272bf1d79b8f0594e677a6f6bf11ff870","observation_id":"2b2cd47a-2e82-4f08-8730-f15f62c23f53","resolution":{"observed_at":"2026-07-30T12:53:41.079462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.088487Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.088487Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:6e3c88051e5955cc83c9f123e6b9c8373a0a4a06b1702154ec342b3e3fbb75ab","observation_id":"ead716dd-08e9-45f8-82e0-348633c9b71a","resolution":{"observed_at":"2026-07-30T12:53:41.088487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-30T12:53:41.096060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.096060Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:ae78dbd59096b2f0275f99180130574f71be4802b12157df9adef066731c3533","observation_id":"8e0c32fe-8577-4f5d-97ec-90c1cca4c89c","resolution":{"observed_at":"2026-07-30T12:53:41.096060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-30T12:53:41.100513Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.100513Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:bc5559fd9a369cdfe62531b619882d143da4298c71b294d56f725163bb19c350","observation_id":"3337b5f0-3d51-4517-a330-ccb02fa01e20","resolution":{"observed_at":"2026-07-30T12:53:41.100513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-16T13:44:03.977685Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-07-30T12:53:41.105706Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.105706Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:fa43b9e957c5e04d37eeb66afa9c1a1eab1f7aa96b0b0a88a93b00522b5d2e23","observation_id":"130db0ba-753b-4621-8371-0c81a93b997d","resolution":{"observed_at":"2026-07-30T12:53:41.105706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-14T21:08:22.323819Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-07-30T12:53:41.111628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.111628Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:1c62c590c2a027db9a84a9412bcdfae4d343d0fc62dfe25a8d8a186e03289709","observation_id":"4be47bb7-04b2-48d5-b48f-175cc1858efc","resolution":{"observed_at":"2026-07-30T12:53:41.111628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29157","last_updated":"2026-05-27T22:50:44Z","snapshot_observed_at":"2026-08-17T06:27:57.635527Z","submitted_at":"2026-05-27T22:50:44Z","title":"Parallax: Parameterized Local Linear Attention for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29157","snapshot_observed_at":"2026-07-30T12:53:41.116534Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.116534Z"},"links":{"cited_paper":"/paper/2605.29157","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:3c53f74508c9c1e779618060e33f711282623fc15eb88be62bf8f963a3e18769","observation_id":"6381bee1-28d0-4edd-926d-8d7797d0d13b","resolution":{"observed_at":"2026-07-30T12:53:41.116534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-07-30T12:53:41.121326Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.121326Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:fa8a1f65e04d030dfbad73c390d4dc3e5a2f8a71277dacc29c87347db20b734c","observation_id":"75dac705-d999-4a3f-bec5-0e797ecd4b76","resolution":{"observed_at":"2026-07-30T12:53:41.121326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-07-30T12:53:41.126522Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.126522Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:16b807fc2b5b8f3a6b5b8ea1c237c9903b94610ed1ee91648f1c8a32b2cd24b0","observation_id":"b7ce3610-a63b-4f44-94d1-14a6decf3732","resolution":{"observed_at":"2026-07-30T12:53:41.126522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.130547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.130547Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:41f6a8948b1e94389eb9025ea9091bc3923ab05911e59a43a15ae3cdd5338c30","observation_id":"87455bc6-5cb8-485e-929a-4c26d58a777c","resolution":{"observed_at":"2026-07-30T12:53:41.130547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-30T12:53:41.139360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.139360Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:a76a6168e0b195d17a44a4905f71318b4bfa07182dd613b4587d7f0f977029e9","observation_id":"ad191bf0-4ca6-4f5c-bb49-cf36bf670141","resolution":{"observed_at":"2026-07-30T12:53:41.139360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.143145Z","title":"DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.143145Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:c4648ccc5b9894771477e73bcfa9e9ea81e47db0c21cb7434c82fe07588a26ad","observation_id":"620e6b72-6b4d-4a11-92a8-b313380f6b19","resolution":{"observed_at":"2026-07-30T12:53:41.143145Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-18T12:11:18.333774Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-07-30T12:53:41.147044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.147044Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:0ebdbf9cf95b5428bf9a1a966f21de1f9257e2636d9effa7f888524b7a0b1179","observation_id":"80569cfd-2968-4e13-864e-cd06e2a97b27","resolution":{"observed_at":"2026-07-30T12:53:41.147044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-30T12:53:41.134632Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.134632Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:d132b930bb39520da09eb2aea270404be0688da03c839fc82c7d14fe32e4d73c","observation_id":"fea8ca95-1122-4e78-ab85-9d8c13c619ce","resolution":{"observed_at":"2026-07-30T12:53:41.134632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04645","last_updated":"2025-06-05T05:28:09Z","snapshot_observed_at":"2026-08-22T15:59:12.026020Z","submitted_at":"2025-06-05T05:28:09Z","title":"Inference economics of language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04645","snapshot_observed_at":"2026-07-30T12:53:41.155145Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.155145Z"},"links":{"cited_paper":"/paper/2506.04645","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:56e2f8be0e3efad7b857cc3b4b5996db58ef60f79b1adbfaa02e7087bb6262f7","observation_id":"c8dc26db-bf8f-4bb6-b57e-7126535a1c92","resolution":{"observed_at":"2026-07-30T12:53:41.155145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.160509Z","title":"Root Mean Square Layer Normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.160509Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:3e8208014c460bbaf3f4fcd91d2be0c005cd4de8b3aef073d3d777887a054c6e","observation_id":"4b2f1fff-d1a5-4f20-9eda-f16568a08cfb","resolution":{"observed_at":"2026-07-30T12:53:41.160509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-07-30T12:53:41.164912Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.164912Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:71ff1ff5b666e5f57dc6c1f43d8c2c20723d4f83e24544ee9a60b23bccfe8dbd","observation_id":"ed33a81e-32e0-4c9c-8d04-753f9a6eba21","resolution":{"observed_at":"2026-07-30T12:53:41.164912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.150792Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.150792Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:cf5ad8d999146e19d09191c94de85690ae29faa69de7ef9d6923ad3d07638b36","observation_id":"36607c74-c48e-4e93-9420-5b0dbde4f094","resolution":{"observed_at":"2026-07-30T12:53:41.150792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-14T19:59:46.270724Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-07-30T12:53:41.174828Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.174828Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:9c1ee164700681d519213d0ae64524ac86b82073fdef1201e67a4b2e3b3d7876","observation_id":"970c7596-d80c-40ac-8060-6449687b52f1","resolution":{"observed_at":"2026-07-30T12:53:41.174828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-08-17T09:16:32.835122Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-07-30T12:53:41.180597Z","title":"Simon, and Jeremy Bernstein.A Spectral Condition for Feature Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.180597Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:1e1f33dea6cc7dc0154de2ecc0f5069705f45e63447549c56c7e157662434104","observation_id":"9c8d2a59-dea0-4030-bb23-dd38c5a17c02","resolution":{"observed_at":"2026-07-30T12:53:41.180597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02244","last_updated":"2023-10-12T17:50:31Z","snapshot_observed_at":"2026-08-16T14:55:24.037926Z","submitted_at":"2023-10-03T17:50:40Z","title":"Tensor Programs VI: Feature Learning in Infinite-Depth Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02244","snapshot_observed_at":"2026-07-30T12:53:41.186767Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.186767Z"},"links":{"cited_paper":"/paper/2310.02244","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:fca25e19526d18dad9189e6c99385ee83a6b7dba6cedb7325f0a99643fc02b2a","observation_id":"1e09b8ad-c1b1-4069-adca-33ab7def3d1a","resolution":{"observed_at":"2026-07-30T12:53:41.186767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-07-30T12:53:41.169794Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.169794Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:be18d92219c1ce2564c0bfe5941306c20eb396f502a27094cc4fb86e0ccdf3cf","observation_id":"5c428c06-d042-42ca-8493-4167a46d629a","resolution":{"observed_at":"2026-07-30T12:53:41.169794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-07-30T12:53:41.205912Z","title":"lr\"], group[","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.205912Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:d8c37cc2788d0adce0473469b86cb1542dc4a1674bb9279cce8ef1539211c05a","observation_id":"f5b7f52a-9f64-4d35-80c5-a5db93db43e4","resolution":{"observed_at":"2026-07-30T12:53:41.205912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:41.191180Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.191180Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:c5effda908fa466eaf0ab5d56dc49a6d3224b1bd1ca539800f2a4b4040d930bf","observation_id":"93edebdd-6373-46d8-a16b-c672ba690870","resolution":{"observed_at":"2026-07-30T12:53:41.191180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-08-14T08:17:47.916907Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28743","snapshot_observed_at":"2026-07-30T12:53:41.195671Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.195671Z"},"links":{"cited_paper":"/paper/2603.28743","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:ee1b20a267f3e01dbfa428e77c84f77ccf8ff0cb516afa72e827e5e00750902e","observation_id":"ad9c477a-93a7-45b9-a38d-34e26d5816b1","resolution":{"observed_at":"2026-07-30T12:53:41.195671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-20T16:41:47.138179Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-07-30T12:53:40.130980Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.130980Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:5b810c8c0b326a029f369d695c195e0f20768e2b5b46777b4d42fd486c930165","observation_id":"ca591d46-0694-44a9-8a69-f1879540b5c5","resolution":{"observed_at":"2026-07-30T12:53:40.130980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T12:53:40.982908Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.982908Z"},"links":{"citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:7d660066d5a5fe83659f5cf4f9f40cc39f867f24dcde9e56ea98253e934715e0","observation_id":"64874ec6-a8ef-4481-9818-fec04fc460fd","resolution":{"observed_at":"2026-07-30T12:53:40.982908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2607.23777."}