{"as_of":"2026-08-19T21:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d8498b05272065937fd35e499744dd267d3c85c8d8b6ac6d52d577a313ce721","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:14:19.151865Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:06:44.940784Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2505.24275","last_updated":"2026-05-20T07:00:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T06:49:57Z","title":"GradPower: Powering Gradients for Faster Language Model Pre-Training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T02:48:23.732350Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2505.24275"},"observation_digest":"sha256:954ff007edcfbe594da27cce724c876c6324798bc4d660d5689a6d33b1e82d7a","observation_id":"25877bc9-d626-4227-85e5-d8ab8e245406","resolution":{"observed_at":"2026-05-22T02:50:58.405641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-08-03T04:14:19.151865Z","title":", Wang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05725","last_updated":"2026-06-03T16:40:26Z","snapshot_observed_at":"2026-08-17T20:44:52.996699Z","submitted_at":"2026-02-05T14:49:40Z","title":"Muon in Associative Memory Learning: Training Dynamics and Scaling Laws","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T04:14:19.151865Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2602.05725"},"observation_digest":"sha256:383d562b7c1abfc5932e3a07e7cd9d2aaed426c9ebe084dbdc8433bc781584e8","observation_id":"3f1e8b5a-c0d8-492c-813a-7a138b35fe2d","resolution":{"observed_at":"2026-08-03T04:14:19.151865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-08-12T22:23:04.265995Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T06:50:29.893126Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2603.10067"},"observation_digest":"sha256:bdd5abef672975cd6af248da47445a2ad2f5158d31ff8a1a081c68c98d9cc461","observation_id":"a360dbec-4d41-4696-b2de-eebb94653473","resolution":{"observed_at":"2026-05-25T06:55:26.251896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2605.05794","last_updated":"2026-05-07T07:32:27Z","snapshot_observed_at":"2026-08-15T16:39:48.024561Z","submitted_at":"2026-05-07T07:32:27Z","title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:51.611115Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2605.05794"},"observation_digest":"sha256:7968b18e31dc73850b12021e10a04558d910708681e9ebeba4fef45dda8e6aa6","observation_id":"c1711373-9d3f-429f-a3a8-4747c24c20ad","resolution":{"observed_at":"2026-05-11T16:41:04.840918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-16T09:55:57.215138Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T07:44:16.677054Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:2f3504e3528956af848bedbcebd6759882f8549afc317cc8d2d46a00cc8e7d1f","observation_id":"3d071d1a-4f3c-4beb-a4fa-a2db5db6bb12","resolution":{"observed_at":"2026-05-22T07:44:42.616826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-16T09:55:57.215138Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:7cb2d959796257ef6494139ad12ee773139baf29620447e96c998ed0ba299950","observation_id":"8b49eecf-6cbd-4f43-9330-9c01c3b7f723","resolution":{"observed_at":"2026-06-30T17:34:57.616526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2606.02365","last_updated":"2026-06-01T15:13:28Z","snapshot_observed_at":"2026-08-12T17:48:57.483330Z","submitted_at":"2026-06-01T15:13:28Z","title":"FOAM: Frequency and Operator Error-Based Adaptive Damping Method for Reducing Staleness-Oriented Error for Shampoo","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T15:49:18.685160Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2606.02365"},"observation_digest":"sha256:af4e02274d93c0b9a3ece246af9f16104b6386ac0e10ea40840014fc9c55e470","observation_id":"d6858e8e-591d-4f87-a6ff-64e406de7cea","resolution":{"observed_at":"2026-07-01T22:06:16.017012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2502.19002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19002","snapshot_observed_at":"2026-07-02T07:06:44.940784Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.arXiv preprint arXiv:2502.19002, 2025a","venue":null,"work_id":"a9ca8057-c003-4e12-b85b-89fe5ffc08c2","year":2025},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-08-12T19:27:04.962406Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":190,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2502.19002","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:c5ffc045438f9f595c1d74f3e69929e46d97ba66731ad8d27fba3a12f8d15c02","observation_id":"492aa194-f467-4031-9608-41f63f9e446c","resolution":{"observed_at":"2026-07-02T07:06:44.942382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.19002/citation-record","integrity":"/paper/2502.19002/integrity","json":"/paper/2502.19002/citation-record.json","paper":"/paper/2502.19002"},"outbound":[],"paper":{"arxiv_id":"2502.19002","last_updated":"2025-06-13T07:42:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T12:55:04.160681Z","submitted_at":"2025-02-26T10:06:37Z","title":"The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2502.19002."}