{"as_of":"2026-08-11T08:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b4272fce48207026f398bca15e44076caae5a1e508ade793df6ac51a3ff840f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:21:20.377243Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-07-06T20:20:14.452585Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T05:57:09.276224Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2501.07237"},"observation_digest":"sha256:b21b73aed5c6eaaadf9393dddd0206edcb162e9279963b69c7f23d69a4b004a6","observation_id":"28c08736-595d-4735-9602-dae2f7e9964a","resolution":{"observed_at":"2026-05-23T05:57:36.655891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-09T12:21:20.377243Z","title":"Everett, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02407","last_updated":"2025-02-04T15:25:47Z","snapshot_observed_at":"2026-08-09T16:18:00.285516Z","submitted_at":"2025-02-04T15:25:47Z","title":"Avoiding spurious sharpness minimization broadens applicability of SAM","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T12:21:20.377243Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.02407"},"observation_digest":"sha256:7148fdba8954865344519412f7029acc00065343919f0334a241b90b449d74fd","observation_id":"b70c9695-3fb7-44af-abc1-b35ac67cf3bb","resolution":{"observed_at":"2026-08-09T12:21:20.377243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-09T11:54:36.874008Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.874008Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:d2d029ee59f8e6712ff68cd940f8774e29f4f5cab52f0b68f653b6c64e772daa","observation_id":"a7e52749-50eb-49f8-8199-6388b3bf013b","resolution":{"observed_at":"2026-08-09T11:54:36.874008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2502.05074","last_updated":"2025-11-10T21:45:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T16:45:40Z","title":"Two-Point Deterministic Equivalence for Stochastic Gradient Dynamics in Linear Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:04.110552Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.05074"},"observation_digest":"sha256:8ce3102d82a35a9fba3821eacf242f565a5dc672ad2db5e875fd4a2aebccdbe6","observation_id":"54ecae26-47be-45b3-96f0-58a71145a502","resolution":{"observed_at":"2026-05-23T04:17:30.972203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T15:39:40.845703Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.05171"},"observation_digest":"sha256:d754eb31eb7f2c1c9c981813be0142cec1c3d7cdbf49e4d80b2a15248f90417c","observation_id":"2d965bc0-1928-4efa-a0e7-9ba8e7c6afd4","resolution":{"observed_at":"2026-05-12T15:39:41.136195Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-07T10:31:20.364789Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.364789Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:ea336750aeae765c49e0bdc00f0a4d1570b7d83e69d44257a800de7000f6f4ad","observation_id":"f225e47c-d49a-40d2-8c6e-9d2916046295","resolution":{"observed_at":"2026-08-07T10:31:20.364789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T20:48:50.834417Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.834417Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:25070917fc19fa832a5ba1ea3527f462d0de384d05ebf656354c9c875b5b2bf3","observation_id":"0231a66f-5898-4deb-a78f-3976de64ab0d","resolution":{"observed_at":"2026-08-06T20:48:50.834417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T20:14:11.824040Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03526","last_updated":"2025-07-04T12:23:45Z","snapshot_observed_at":"2026-08-09T14:11:38.132882Z","submitted_at":"2025-07-04T12:23:45Z","title":"Decoupled Relative Learning Rate Schedules","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:14:11.824040Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.03526"},"observation_digest":"sha256:a9de46393baa8da4a688044e227e3d3499111d8c6e426dc798aaf8c313877a27","observation_id":"e0385b0d-7ebe-4c00-8d84-3431dec3bbdc","resolution":{"observed_at":"2026-08-06T20:14:11.824040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T14:17:37.081920Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19680","last_updated":"2025-07-25T21:19:37Z","snapshot_observed_at":"2026-08-07T16:14:29.307306Z","submitted_at":"2025-07-25T21:19:37Z","title":"Feature learning is decoupled from generalization in high capacity neural networks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T14:17:37.081920Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.19680"},"observation_digest":"sha256:4ab7c9f5cd2b75e1daed8025ddfc495d5659dba4f00fa8e231413ed6350d7ab8","observation_id":"1af5ec08-b7dd-43b3-acae-d35d9369cca7","resolution":{"observed_at":"2026-08-06T14:17:37.081920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2602.04774","last_updated":"2026-05-08T16:24:57Z","snapshot_observed_at":"2026-08-03T01:34:12.578849Z","submitted_at":"2026-02-04T17:11:36Z","title":"Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T06:58:38.927268Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2602.04774"},"observation_digest":"sha256:77de482afbf4f7aba61a62b673f1f1ad9070dd2a8fa2b2a581d6b290687e759a","observation_id":"f93461aa-05fe-4da9-adf6-69f66ffbcde1","resolution":{"observed_at":"2026-05-16T07:00:43.299777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2604.12946","last_updated":"2026-04-14T16:43:37Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T16:43:37Z","title":"Parcae: Scaling Laws For Stable Looped Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:33:04.442462Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2604.12946"},"observation_digest":"sha256:756fe65f26b12f0a661e2197c7c2af819b75bc96bac5f90443f3dbe2328d8232","observation_id":"9102af60-12fc-4a52-b523-61953e1188a0","resolution":{"observed_at":"2026-05-11T10:21:01.021466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2604.13521","last_updated":"2026-04-15T06:10:12Z","snapshot_observed_at":"2026-07-30T06:08:24.697906Z","submitted_at":"2026-04-15T06:10:12Z","title":"C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:02:52.920735Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2604.13521"},"observation_digest":"sha256:49f713a7c3e96ce25ca3acdfdabacaaedb7d5b1791aaf37cc891c6e2dd4e778b","observation_id":"a223976d-c983-44ac-85da-6472e97be7d7","resolution":{"observed_at":"2026-05-10T13:05:24.996003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2604.27077","last_updated":"2026-05-01T03:33:05Z","snapshot_observed_at":"2026-08-08T14:31:34.266875Z","submitted_at":"2026-04-29T18:11:42Z","title":"Learning Rate Transfer in Normalized Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T09:01:45.365126Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2604.27077"},"observation_digest":"sha256:7a7f745fce5e1a30ec94ed026c3fb5bc9d73c12a5b27aea46ff2a43aa0f0cca1","observation_id":"805efe36-d7e0-4353-96ba-7b0aba39edc1","resolution":{"observed_at":"2026-05-12T09:51:28.083967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2605.11170","last_updated":"2026-06-02T13:57:02Z","snapshot_observed_at":"2026-08-02T02:13:17.912919Z","submitted_at":"2026-05-11T19:28:33Z","title":"Unlearning with Asymmetric Sources: Improved Unlearning-Utility Trade-off with Public Data","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-13T05:56:38.042978Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2605.11170"},"observation_digest":"sha256:ea6e8e07a8e2195c7a4d78d689de8acc7a0e70cf7009ea789f8cfdbc8d7bf571","observation_id":"2e55164d-4c29-441a-a4e6-ec14cbc6e6b6","resolution":{"observed_at":"2026-05-13T05:57:21.512477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:04a9f9b187df7a16d0279e1ad68956bf7b94c284dd2bd329d36ee688f2474928","observation_id":"d85931f2-99b1-4294-9198-7a845be45fa1","resolution":{"observed_at":"2026-05-15T04:49:44.837389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2605.15290","last_updated":"2026-05-14T18:03:16Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:03:16Z","title":"GQA-{\\mu}P: The maximal parameterization update for grouped query attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:40.231293Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2605.15290"},"observation_digest":"sha256:65967433916b890d13d4eea95ce51b1c5e49204a72e7e03fd596920473f23cdf","observation_id":"fa8b0839-ae38-430c-8d99-827db6b9e8fc","resolution":{"observed_at":"2026-05-19T16:37:39.842088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2606.20299","last_updated":"2026-07-01T14:03:37Z","snapshot_observed_at":"2026-08-09T16:51:41.612467Z","submitted_at":"2026-06-18T14:35:53Z","title":"Statistical Properties of Training & Generalization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T15:35:51.654392Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.20299"},"observation_digest":"sha256:380b183ea24cca25da36977fdf28c6a44bb6d40dea8380c9dff860a6a8c869ab","observation_id":"08b3d673-2af3-4b48-a3b2-09dd84cd135e","resolution":{"observed_at":"2026-06-26T15:39:33.195350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2606.20299","last_updated":"2026-07-01T14:03:37Z","snapshot_observed_at":"2026-08-09T16:51:41.612467Z","submitted_at":"2026-06-18T14:35:53Z","title":"Statistical Properties of Training & Generalization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-02T21:51:13.457071Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.20299"},"observation_digest":"sha256:425dfc226f9545a32f16254f735b1922cd863abef4eb7da6bb8e6800fdc0b862","observation_id":"d0848018-1c61-4497-a063-900a48ac9109","resolution":{"observed_at":"2026-07-02T21:57:25.317838Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:56f69510e13c1390c08401cb47f65a6a2f7f320f6b9fe338faca3d6772ef3148","observation_id":"38c7f7b7-d4c8-4b42-8683-bb38aed6a0d7","resolution":{"observed_at":"2026-07-04T20:30:07.676652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-02T10:14:06.198299Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:06.198299Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:ca0dcbaaa6f3283a898ed476c70c6575813ef30ddb66ec6b7ef9627afe9f8fc3","observation_id":"44235205-ee6f-4780-be28-54aab9ef7635","resolution":{"observed_at":"2026-08-02T10:14:06.198299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-02T06:45:17.238514Z","title":"Scaling exponents across parameterizations and optimizers.arXiv preprint arXiv:2407.05872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-06T06:09:03.498548Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.238514Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:2f26039746860b96097522dcbb7e075680a84ddf31c1c7553bf2fb55ac508be8","observation_id":"0ca474ff-08db-4668-8d38-4b65e51d4f23","resolution":{"observed_at":"2026-08-02T06:45:17.238514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.05872/citation-record","integrity":"/paper/2407.05872/integrity","json":"/paper/2407.05872/citation-record.json","paper":"/paper/2407.05872"},"outbound":[],"paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2407.05872."}