{"as_of":"2026-08-15T06:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbdfbe47916091eb6f98ea04996aab3b1c240f62ac131255015d7b1c15c0765c","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:58:56.074206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22297","snapshot_observed_at":"2026-08-02T01:58:56.074206Z","title":"Di He, Songjun Tu, Ajay Jaiswal, Li Shen, Ganzhao Yuan, Shiwei Liu, and Lu Yin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14536","last_updated":"2026-07-16T03:42:21Z","snapshot_observed_at":"2026-08-14T00:59:23.434969Z","submitted_at":"2026-07-16T03:42:21Z","title":"Muse: Representation Geometry of Muon Beyond Normalized Momentum","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:58:56.074206Z"},"links":{"cited_paper":"/paper/2605.22297","citing_paper":"/paper/2607.14536"},"observation_digest":"sha256:655f74498b1310ad59163c92b3c0f674dc8e6898f62bd28ca8f2cb840f755cc3","observation_id":"10f40f6a-933f-426d-ad80-6a7aac84ea9b","resolution":{"observed_at":"2026-08-02T01:58:56.074206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.22297/citation-record","integrity":"/paper/2605.22297/integrity","json":"/paper/2605.22297/citation-record.json","paper":"/paper/2605.22297"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:5b1ab03f8b1313dba661c269e5a1ca5ac87911117db20e0a2600a664b15512ab","observation_id":"819e1380-7647-451f-85fc-da480930b13f","resolution":{"observed_at":"2026-06-30T17:34:57.584086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01618","doi":"10.48550/arxiv.2505.01618","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don’t be lazy: Completep enables compute-efficient deep transformers","venue":"ArXiv.org","work_id":"85f11780-ed20-4881-8d31-bb0834b58027","year":2025},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:55a4c013bd18885f69043b20f2bbeeebfda488e43817b89d156289faa7593a4d","observation_id":"cbe0943e-ee89-4248-9b27-fbfc0a7c29cd","resolution":{"observed_at":"2026-06-30T17:34:57.587016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-14T19:02:22.526647Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"cited_work":{"arxiv_id":"2506.15025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15025","snapshot_observed_at":"2026-06-30T17:34:57.593618Z","title":"and Liu, L","venue":null,"work_id":"0c9aed32-c6c5-4249-a693-b94ad28fb680","year":null},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2506.15025","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:15437592ef2b4d022e12c24f53dec11c2381300049fc0fd9ec9bdc0de4ba4eff","observation_id":"bc462715-4679-4150-bef0-3cee690c782f","resolution":{"observed_at":"2026-06-30T17:34:57.595450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.14562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:06:44.755049Z","title":"Alphadecay: Module-wise weight decay for heavy-tailed balancing in llms.arXiv preprint arXiv:2506.14562","venue":null,"work_id":"2a6ec702-f7e3-4fa8-90fe-a65d967a9682","year":2026},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:9095065cca047c6dbe37f6f464eb35b83e0af1ee0ff1d204e4d0faad50f72732","observation_id":"f9de646d-499a-4748-9436-1d405e734dfd","resolution":{"observed_at":"2026-06-30T17:34:57.601205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:56e49fcc673606bb3d9c6322faef038a622b2362af26419aa37069ac30b8894d","observation_id":"67fc3bb7-d4f8-4a94-9474-7e88faef9e28","resolution":{"observed_at":"2026-06-30T17:34:57.633293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01933","last_updated":"2023-10-09T15:38:46Z","snapshot_observed_at":"2026-08-13T12:09:20.320930Z","submitted_at":"2023-04-04T16:31:37Z","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":"2304.01933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.01933","snapshot_observed_at":"2026-07-04T06:39:37.904271Z","title":"Llm-adapters: An adapter family for parameter-efficient fine-tuning of large language models.arXiv preprint arXiv:2304.01933","venue":null,"work_id":"da13b885-999b-4bff-a2e2-152b2a43abf9","year":2023},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2304.01933","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:83809ecd66803f8f37b0a54ec05c04a65987af0f13902222b88cef1ecd41e322","observation_id":"fe5e839b-61a3-46ef-a501-15c2a0fe2df3","resolution":{"observed_at":"2026-06-30T17:34:57.589775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:c5e4fcf70700dd3c3604c4f40a9b45cdb2c4f5fbfa707e4fda1dc91433ae06f9","observation_id":"400b49a7-d530-4f35-8c50-7b2f34679cef","resolution":{"observed_at":"2026-06-30T17:34:57.604761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12178","last_updated":"2024-10-16T02:48:39Z","snapshot_observed_at":"2026-08-14T12:07:07.579182Z","submitted_at":"2024-10-16T02:48:39Z","title":"Model Balancing Helps Low-data Training and Fine-tuning","version":1},"cited_work":{"arxiv_id":"2410.12178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12178","snapshot_observed_at":"2026-06-30T17:34:57.625971Z","title":"Model balancing helps low-data training and fine-tuning","venue":null,"work_id":"2679ada2-28e4-44d6-85c6-819d4f0374e9","year":null},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2410.12178","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:ffaedefda5f2b5f6b8f6a5fb1c86f4648df067290dfd6367691035b614e018eb","observation_id":"15ab6c0a-27ba-4ae0-8781-557c59d4bbb8","resolution":{"observed_at":"2026-06-30T17:34:57.627601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:3d35dc9ff01fc03c921cfbdfe8e8f9fafe17729b0db87064ed148d88bb16da6e","observation_id":"335f0174-667c-4858-9817-ade1ff1f7da0","resolution":{"observed_at":"2026-06-30T17:34:57.624687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08276","last_updated":"2019-01-24T08:20:42Z","snapshot_observed_at":"2026-08-14T17:26:38.187837Z","submitted_at":"2019-01-24T08:20:42Z","title":"Traditional and Heavy-Tailed Self Regularization in Neural Network Models","version":1},"cited_work":{"arxiv_id":"1901.08276","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.08276","snapshot_observed_at":"2026-07-04T02:59:25.669161Z","title":"Traditional and Heavy-Tailed Self Regularization in Neural Network Models","venue":"cs.LG","work_id":"9b7bf9ee-a70a-4276-be72-6a823a0329d6","year":2019},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1901.08276","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:a5c02c77e66c3bd54ee1c049cc1b1cfd57767c9a0ce29b102545ae79c1c7c585","observation_id":"2c26e020-6f35-494f-bbb9-bcd4e03b191f","resolution":{"observed_at":"2026-06-30T17:34:57.621695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":"1809.02789","doi":"10.48550/arxiv.1809.02789","metadata_source":"pith","pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":"cs.CL","work_id":"b9d68fc0-5b23-4def-bc5e-6ad71d64eec6","year":2018},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:bddc2bc8de3532acff9094b852c3aac712f0e08f6ea309d1c5563f40cee5b525","observation_id":"cec8cb3f-1977-48a2-b2df-caee9a25e30b","resolution":{"observed_at":"2026-06-30T17:34:57.630682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":"2406.17557","doi":"10.48550/arxiv.2406.17557","metadata_source":"pith","pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":"cs.CL","work_id":"1ac90585-1330-4f90-8836-6382fa63c4eb","year":2024},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:989c0a48ebe5c44545e08b3af08264647433d4a0640bf2ab32b2cb962b39cd63","observation_id":"1be24f73-fb06-45b3-82d2-97602b6189a3","resolution":{"observed_at":"2026-06-30T17:34:57.613690Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-14T20:38:10.326889+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T20:38:10.326889+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":"1904.09728","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-07-08T01:44:26.198243Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","venue":"cs.CL","work_id":"3f93670e-0ae7-40e5-bed5-74c216638dd1","year":2019},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:6e64f9e63528ae458f619a05fa754dfbe0d1e670a39b2aa72ad9cfc429f0a0b4","observation_id":"5eb45495-a603-400a-bc8a-6c3873053e2a","resolution":{"observed_at":"2026-06-30T17:34:56.910283Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-09T15:16:14.895890Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:262c7e1bb5b9d516df21f064c6b2a352b068ecd1a9e5d6e53cfac88d7909248a","observation_id":"8b49eecf-6cbd-4f43-9330-9c01c3b7f723","resolution":{"observed_at":"2026-06-30T17:34:57.616526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14522","last_updated":"2022-07-15T17:04:24Z","snapshot_observed_at":"2026-08-10T23:48:51.698481Z","submitted_at":"2020-11-30T03:21:05Z","title":"Feature Learning in Infinite-Width Neural Networks","version":3},"cited_work":{"arxiv_id":"2011.14522","doi":"10.48550/arxiv.2011.14522","metadata_source":"arxiv_reference","pith_arxiv_id":"2011.14522","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Hu, E","venue":"arXiv (Cornell University)","work_id":"421a60be-6eaa-4316-95cf-702cbf17f055","year":2011},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2011.14522","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:b08e1e0f4d701576043f4a6b3c67e88109ae44d73a86f5dafeb7c23969cdc5bd","observation_id":"1eb83793-db37-4efa-95da-fff07bd1647f","resolution":{"observed_at":"2026-06-30T17:34:57.603774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:4d24ba7419af4bc4d784634d0f490d77129ce503a17c47ad51a40a4e44b613b0","observation_id":"e9a303f1-aa0d-4451-af4e-933cde503842","resolution":{"observed_at":"2026-06-30T17:34:57.606238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":"1904.00962","doi":"10.48550/arxiv.1904.00962","metadata_source":"pith","pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","venue":"cs.LG","work_id":"206d2a89-691e-4467-8958-5630dacf4765","year":2019},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:33c2cc0ca34cd6a38e56f2bbe13209e7d5355a414857da7c1fd35ffa901d0507","observation_id":"e173ea4f-b4a6-42d8-8117-72b6db0c3b36","resolution":{"observed_at":"2026-06-30T17:34:57.608787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:183250ea523853d97362ba93f4ca096cc9cfb59e493e94d862601654a215df53","observation_id":"1112d5bd-7908-4d8c-b9f0-4a1d17511620","resolution":{"observed_at":"2026-06-30T17:34:57.611239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-12T23:35:57.084703Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":"2406.16793","doi":"10.48550/arxiv.2406.16793","metadata_source":"pith","pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam-mini: Use fewer learning rates to gain more.arXiv preprint arXiv:2406.16793","venue":"cs.LG","work_id":"988d7ebd-209d-4382-80e6-0d367b74e767","year":2024},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:4f25cffd131c1902df431c66fde84dfc8f144866c31d689c3ffe2d4ffcdf50db","observation_id":"7e02c1ac-30c9-489b-a4c3-8e5c92189eac","resolution":{"observed_at":"2026-06-30T17:34:57.598365Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:50.064080Z","title":"Details of Experiments This section provides detailed configurations for both pre- training and finetuning experiments","venue":null,"work_id":"e4553923-c49b-4f65-bbd4-4a5992d1eefe","year":2048},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:dbc22f9eece33c53f706a7b4fc2c1bbf7e06cfe30ac5bcc9e6d49611dd1240fa","observation_id":"7f1bf2a3-b974-4d96-a975-cf417390f4bb","resolution":{"observed_at":"2026-07-08T08:54:50.066199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8617.0217","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:34:57.617653Z","title":"Among these, Linear achieves the best results across all LR settings, showing a notable advantage over other methods","venue":null,"work_id":"a735feec-7467-4c05-aef4-3f401d59584e","year":2014},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:a8af1dc85b7ee73875c719b2a22c1ce57b1d9dcaef3c02a456a34db3ca4b6646","observation_id":"02c5b434-0d25-44cd-b0b6-d74a456cb6bb","resolution":{"observed_at":"2026-06-30T17:34:57.619301Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":15,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2605.22297."}