{"as_of":"2026-08-14T19:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03cb2365b7ec6b4ab03df37a4a5957279cf06fd0776d2a2c1f58d76bd59894ae","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:32:04.384284Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:27:56.628221Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:40:24.372091Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-08-04T12:38:53.777630Z","title":"Why gradients rapidly increase near the end of training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-14T12:29:49.923863Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.777630Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:9ced6623c15037d34ee809dbf7793fe92642c643acc6ab261b1a6eb0db4f730c","observation_id":"57c806d0-96f4-4a92-99f6-aedbce155fcc","resolution":{"observed_at":"2026-08-04T12:38:53.777630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-08-03T19:10:48.092792Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv:2506.02285,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02342","last_updated":"2026-06-01T07:48:25Z","snapshot_observed_at":"2026-08-13T11:56:59.121415Z","submitted_at":"2025-12-02T02:24:32Z","title":"Safeguarded Stochastic Polyak Step Sizes for Non-smooth Optimization: Robust Performance Without Small (Sub)Gradients","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T19:10:48.092792Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2512.02342"},"observation_digest":"sha256:e8f31380f4333ad63d0b40e35da313179319162090358afe2a89739ed3ba710e","observation_id":"574e5e0b-156e-4985-8126-dcf919846b31","resolution":{"observed_at":"2026-08-03T19:10:48.092792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-08-14T08:17:47.916907Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T21:51:14.678941Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2603.28743"},"observation_digest":"sha256:6ede3703997fb1f95a945b72d205fae41f5e4884ca8e5285f6fdccec7b25c2b4","observation_id":"4f6d60b2-9096-4fc1-ae1f-5a2baabaab1e","resolution":{"observed_at":"2026-05-14T21:53:02.525835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2604.13483","last_updated":"2026-04-15T05:14:45Z","snapshot_observed_at":"2026-07-06T23:01:28.082506Z","submitted_at":"2026-04-15T05:14:45Z","title":"Broximal Alignment for Global Non-Convex Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:57:52.201675Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2604.13483"},"observation_digest":"sha256:007f04562cdba4b7b6c0be6e29777f462ab93103d2a1d0293b74b980c93f9bab","observation_id":"f0d07f9d-136b-4fa3-8284-a26bcbc926ab","resolution":{"observed_at":"2026-05-10T13:00:24.674807Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-08-13T03:09:23.849783Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:a992d3348c205fd64539f3d132b1022ddc51bc29462a2f8dd4a29bd2fd478f8c","observation_id":"366a7266-7668-49cf-a79c-f180b3c32392","resolution":{"observed_at":"2026-05-11T17:16:08.661283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:d944a50588b8177eb4ec305153f240ef6ada0cb7a00f5cf0a22c6f2be781623b","observation_id":"2c37b115-b48a-4f6b-83e9-cfa5e1166495","resolution":{"observed_at":"2026-05-11T19:26:08.465260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:cde0d0611939e8694fdef2c088ea98797f70fc418729ce1fbb8366ce4a3e8a9f","observation_id":"41ab2342-e1d9-4e23-96d5-104b291b08d0","resolution":{"observed_at":"2026-05-25T05:40:24.375625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv:2506.02285, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:ca7579b5ec9d1064118de9746a5ec9d527b02148a090504183def014f6f9c316","observation_id":"75168a28-59d3-473b-a6c4-d52b80b9be66","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-07-30T12:53:40.954445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.954445Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:f3be84eb93919ab4398673e9ac786927e96a6ab3ba52a54c8e64ca418ad9a52a","observation_id":"cf743017-35ec-4b6e-a066-38f82f0bb173","resolution":{"observed_at":"2026-07-30T12:53:40.954445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-08-14T04:27:56.628221Z","title":"arXiv preprint arXiv:2506.02285 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08888","last_updated":"2026-08-09T19:59:45Z","snapshot_observed_at":"2026-08-14T04:19:08.724752Z","submitted_at":"2026-08-09T19:59:45Z","title":"Full-bandwidth transformer","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:27:56.628221Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2608.08888"},"observation_digest":"sha256:69290367473bb5b69bb4173cf72b98ccb36c23894cfc7b75390a5397f6e55240","observation_id":"adbc6f64-beda-4a03-9c7f-03f92a182b1a","resolution":{"observed_at":"2026-08-14T04:27:56.628221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02285/citation-record","integrity":"/paper/2506.02285/integrity","json":"/paper/2506.02285/citation-record.json","paper":"/paper/2506.02285"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-14T05:15:12.190552Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T11:32:02.886552Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:02.886552Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:e33f5534f90250a30a60fb0e4a076e9ae8889664bde2b58fea1313521d1a8046","observation_id":"8667ed2e-7c56-4e37-a221-106fbab8bc69","resolution":{"observed_at":"2026-08-07T11:32:02.886552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.465747Z","title":null,"venue":null,"work_id":"d156d2ea-81f8-4e22-a455-0e4f153559a0","year":2020},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:02.936151Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:74f8f1c169b58b00c5dbad7eb25d6e1dfb79b8be0429b587a8c86a059e32c4a3","observation_id":"7672aa3e-7fed-494e-ab7b-b28e33ba24e4","resolution":{"observed_at":"2026-08-07T11:32:06.594928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.282508Z","title":null,"venue":null,"work_id":"4ebee952-bd3b-4817-bfd7-e88e459faf80","year":2018},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.009411Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:f2350e74a8f5880a768cc8706fa8b10744f26b6a528bce83e7b69f899f035050","observation_id":"5531a407-aaf0-4ace-8ac2-0c91d91a7ef6","resolution":{"observed_at":"2026-08-07T11:32:06.390649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.973185Z","title":null,"venue":null,"work_id":"91a1160e-4a91-4160-aadd-fd7aadb4aac9","year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.095688Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:54d4bb2180ab0bd4b0dff4eb700a4113cc5040216cfe30c5243ea2dc7b2d08b6","observation_id":"c6c93d21-9bbd-48e5-bd22-a63995c07b03","resolution":{"observed_at":"2026-08-07T11:32:06.122567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.723520Z","title":"and Bottou, L","venue":null,"work_id":"0369bd2b-6f91-487f-ad07-63171e750189","year":2022},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.175874Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:ec01830afdc2cc8f67d9cef4899a58478deb5bb821e8edc293df56724cf67ad7","observation_id":"08db36d8-a0df-4c7c-8936-ef46e243c71d","resolution":{"observed_at":"2026-08-07T11:32:05.877245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.495697Z","title":null,"venue":null,"work_id":"bfd503ca-1d36-4936-ba88-1fba7681d09c","year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.230459Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:0e76aff77242c17191a8c78f356161da6ffdce1638d5b74f7235aa9af793336b","observation_id":"4b0b303b-89ab-4fd6-bd30-7809a85fbde7","resolution":{"observed_at":"2026-08-07T11:32:05.627056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.275141Z","title":"and Gower, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.275141Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:c20567f307c6272d47661a7f9aa0e904c033774c8207603e965cee40123bd986","observation_id":"2be33ce0-a8e0-4f4e-a52d-2e5194feacd1","resolution":{"observed_at":"2026-08-07T11:32:03.275141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.377669Z","title":"and Mishchenko, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.377669Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:e172a10740f0479deeb04b2bbadfcc8dcc6bbc95b799da1c8163cb03ab558c29","observation_id":"9a60bbc3-005f-40d8-9af8-f4a85fee0872","resolution":{"observed_at":"2026-08-07T11:32:03.377669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.369481Z","title":null,"venue":null,"work_id":"fd5a959b-29d8-4560-81eb-1156f1bc33be","year":2011},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.474851Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:021d262ff4d0946f89fcc8d290b4d101ae1719514bfc82468f4f0e3753ac2d9e","observation_id":"4f5789c7-82a3-4da5-974f-41a7fc2e7191","resolution":{"observed_at":"2026-08-07T11:32:05.400559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.303581Z","title":null,"venue":null,"work_id":"2dfafeae-aa12-473d-b3c4-79b3a8c218d2","year":2016},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.579676Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:53683e2f42f0f65c244f5907da6cd89549c54f34afc7942093a0d11fe9314b9e","observation_id":"27c72ec4-65e5-4f5a-a0ea-94f42066bec4","resolution":{"observed_at":"2026-08-07T11:32:05.334360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.208107Z","title":"and Szegedy, C","venue":null,"work_id":"1afcdfa2-9e2d-4edb-ac80-1c8a9af5e5ff","year":2015},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.676898Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:7a35f56be0c3efe52a7b1d39b7ed38fe19d7074c4caaed02a86a74210542eeee","observation_id":"ef705d8e-9ab2-4a36-a65c-b673f8576b72","resolution":{"observed_at":"2026-08-07T11:32:05.238177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.723875Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.723875Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:dc1afc012d5f5eb15712ab5a15493853540982c337ab5e9fb33aa3cf4e003fb6","observation_id":"9263c93b-63c6-4827-a537-8a53c4918d37","resolution":{"observed_at":"2026-08-07T11:32:03.723875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.811301Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.811301Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:2416c5caf8552dd4d5b179d61623615efb473786c026453c138b24fbf4797b26","observation_id":"636ae290-6d76-4cf3-b12e-1e9760ad81d5","resolution":{"observed_at":"2026-08-07T11:32:03.811301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-07-06T08:47:45.187408Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-07T11:32:03.877272Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.877272Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:d1f5083560f4e7dab4d421480bd4c0535cfe3204c7f1b91679dd85d7e086589b","observation_id":"4611d213-a767-43d1-a745-7f4e4bce64e4","resolution":{"observed_at":"2026-08-07T11:32:03.877272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.030079Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":"d218e7b7-7771-4167-9333-0ddd40673b1b","year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.915870Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:722a1ac011b3e599f29957c2a14c057666e047796234e1a61810899d15e6c0d6","observation_id":"28337d32-f3c9-4675-ba61-592f81b7276a","resolution":{"observed_at":"2026-08-07T11:32:05.093205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.926981Z","title":"C., and Fei-Fei, L","venue":null,"work_id":"c0900d51-c428-4fbd-878d-9ff557aa3a16","year":2015},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.994499Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:a68fa343a66a16ea7fc7977673670d49b2da2f5a78bbb535920255055a6f9a40","observation_id":"66ba23e5-347c-45bc-af2c-85bb6040e140","resolution":{"observed_at":"2026-08-07T11:32:04.951450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.824687Z","title":null,"venue":null,"work_id":"ce5076f6-8c28-4106-803a-9cea33b5d0e0","year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.050469Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:8e77749f89a1b35e104fd96371eccf8f5152200f4d89254d81937d9aaa3b1d75","observation_id":"817e3174-5ca4-4ea4-81ba-0167e048b52c","resolution":{"observed_at":"2026-08-07T11:32:04.884836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05350","last_updated":"2017-06-16T17:08:08Z","snapshot_observed_at":"2026-08-06T22:03:25.581947Z","submitted_at":"2017-06-16T17:08:08Z","title":"L2 Regularization versus Batch and Weight Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05350","snapshot_observed_at":"2026-08-07T11:32:04.103673Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.103673Z"},"links":{"cited_paper":"/paper/1706.05350","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:3c66fba18b5f64b5e66071f3b843cc4013302c0409a2cffac5795b14792a6ab0","observation_id":"7c43b120-6677-4a8d-b09a-739151b93b4c","resolution":{"observed_at":"2026-08-07T11:32:04.103673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04454","last_updated":"2024-04-05T23:56:50Z","snapshot_observed_at":"2026-08-13T00:36:45.005789Z","submitted_at":"2024-04-05T23:56:50Z","title":"Implicit Bias of AdamW: $\\ell_\\infty$ Norm Constrained Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04454","snapshot_observed_at":"2026-08-07T11:32:04.192151Z","title":"and Li, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.192151Z"},"links":{"cited_paper":"/paper/2404.04454","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:11f0f53bdfe17d0d5b1938eebac507ab017b1fc206538935d5bc239486b49c0a","observation_id":"69a1258c-d2bc-4057-a133-b27204da1a16","resolution":{"observed_at":"2026-08-07T11:32:04.192151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.738959Z","title":null,"venue":null,"work_id":"7e390f8b-bce1-465b-8184-ddf8afcf8d6d","year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.246337Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:358449cdee102b772a9ebb7b9781ef6c161fc2e9bf1319f00879620e37a9996c","observation_id":"6b97a015-9c9b-499f-b25b-f1fbb9092572","resolution":{"observed_at":"2026-08-07T11:32:04.764571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.592559Z","title":null,"venue":null,"work_id":"c9bee3a8-a361-4914-9a91-285682412ffb","year":2019},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.332003Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:a79d41d824cd5d2dfac1b22cace3f290368dadb7b5fbd90e9acec2d2c36eb8d2","observation_id":"7db33698-d989-43f0-955a-82cd872ea666","resolution":{"observed_at":"2026-08-07T11:32:04.653154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.478542Z","title":null,"venue":null,"work_id":"086a51d3-ae29-4bff-8bee-2d6e78782624","year":2022},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.384284Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:9619baf241c113683fda72706bcb5b6755b203b1e3302ee819fa1b18ef41eea2","observation_id":"4e3c916a-4668-49dc-9a72-591cd53e0501","resolution":{"observed_at":"2026-08-07T11:32:04.541396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 10 inbound Pith citation observations for arXiv:2506.02285."}