{"as_of":"2026-08-03T23:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85c0fd1322b0c9fd8d61d1def2d4a11401663434744ed8baa8541521fe8b54c7","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T12:00:49.127471Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:13:39.201865Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T11:56:55.992114Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"cited_work":{"arxiv_id":"2605.06654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06654","snapshot_observed_at":"2026-07-02T11:56:55.992114Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","venue":"cs.LG","work_id":"cfd2294f-6e60-4281-b49d-edcaaaa55ab8","year":2026},"citing_paper":{"arxiv_id":"2606.06418","last_updated":"2026-06-04T17:22:58Z","snapshot_observed_at":"2026-08-02T08:47:15.917924Z","submitted_at":"2026-06-04T17:22:58Z","title":"Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss","version":1},"reference_index":185,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:39.845487Z"},"links":{"cited_paper":"/paper/2605.06654","citing_paper":"/paper/2606.06418"},"observation_digest":"sha256:e51c79b1bc9dfa8672ea647abdd6f09f6542473482bdb066b6f9631c3e90389c","observation_id":"0dcd802d-c6f2-4675-a64f-0c12f2d4c537","resolution":{"observed_at":"2026-07-02T11:56:55.993275Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06654","snapshot_observed_at":"2026-08-01T21:13:39.201865Z","title":"Liu,Z.;Zhang,R.;Wang,Z.;Zhao,Y.;Su,Y.;Yang,Z.;andZhang, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-07-30T06:22:25Z","snapshot_observed_at":"2026-08-02T23:18:26.744662Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:13:39.201865Z"},"links":{"cited_paper":"/paper/2605.06654","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:6f3839095cb3e5a8b3f90bc98b4175c3a793f52ebc3f0250d4e4e7287d330548","observation_id":"259292d8-88cf-4435-a378-1f4e34a0f944","resolution":{"observed_at":"2026-08-01T21:13:39.201865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.06654/citation-record","integrity":"/paper/2605.06654/integrity","json":"/paper/2605.06654/citation-record.json","paper":"/paper/2605.06654"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:29:54.485236Z","title":"arXiv preprint arXiv:2512.16928 , year=","venue":null,"work_id":"06ab448a-e346-485e-8f8b-37394e6aacd4","year":2002},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:5e56a8ac5f6daa49b61bed23aca706cf9e75f1c29cd069a6330c838d181a31ba","observation_id":"c2207734-b6f6-42fc-a872-15b9fd029f84","resolution":{"observed_at":"2026-05-11T19:26:08.621624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08056","last_updated":"2020-02-19T08:45:54Z","snapshot_observed_at":"2026-07-06T08:58:23.740497Z","submitted_at":"2020-02-19T08:45:54Z","title":"The Geometry of Sign Gradient Descent","version":1},"cited_work":{"arxiv_id":"2002.08056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.08056","snapshot_observed_at":"2026-07-04T10:09:44.617472Z","title":"The geometry of sign gradient descent.arXiv preprint arXiv:2002.08056","venue":null,"work_id":"f21e3dd4-b8a2-4d68-a027-50f7a8adb90a","year":2002},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2002.08056","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:ec02c87bf9cc5b4ce1b74969e1160f7f9c1b308fa8933ce1858fed39e2b590fe","observation_id":"1a26534a-2a18-4038-9238-482c3f75d6d6","resolution":{"observed_at":"2026-05-11T19:26:08.613799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:c0ef45cbf08667318b6a5212d82c54f44964c40d74bb1866165e110736c47a63","observation_id":"7f285ec0-7c51-4989-94a2-5e67b5bff8f7","resolution":{"observed_at":"2026-05-16T07:27:53.041705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-07-06T18:14:58.609087Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":"2405.09673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-07-04T19:30:07.259186Z","title":"Biderman, J","venue":null,"work_id":"ca00d37c-5297-4fa7-b692-52260eb614f2","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:1ed4983f8c444420c1b49e26a38bb9880b5d14e5747d35aded14ed86430a1482","observation_id":"ad4e9f03-6c4e-478a-826b-f9b537b6122c","resolution":{"observed_at":"2026-05-11T19:26:08.668232Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-07-06T21:35:27.380132Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:2de5ad19f8eaa7ee24d41fc7b52f0e2dbabe59d9d8bde7ee4b42aeaf1b585e4d","observation_id":"2c37b115-b48a-4f6b-83e9-cfa5e1166495","resolution":{"observed_at":"2026-05-11T19:26:08.465260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:5ccc579951d75629c7e7fe52630bdd4446be963faa943f6554a888cf615fcead","observation_id":"9aa17456-7f4c-4915-8828-f9adb80ba8cb","resolution":{"observed_at":"2026-05-11T19:26:08.588850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:1c308970c8997efc29de80a3216c59e865e55faab54a4420c7471045e9c21786","observation_id":"7d23d21a-41e1-4567-924e-045438fda472","resolution":{"observed_at":"2026-05-11T19:26:08.454674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00099","last_updated":"2023-05-09T14:08:17Z","snapshot_observed_at":"2026-07-06T13:26:38.135401Z","submitted_at":"2022-06-30T20:48:26Z","title":"Measuring Forgetting of Memorized Training Examples","version":2},"cited_work":{"arxiv_id":"2207.00099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00099","snapshot_observed_at":"2026-07-04T21:10:09.130679Z","title":"Measuring forgetting of memorized training examples","venue":null,"work_id":"77c404a2-a502-42d0-aa44-85d03ec09bf9","year":2022},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2207.00099","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:595d59336ea992c85f16e8f5801ec4c4ffef435692cb439d005cf287666b9c97","observation_id":"75507299-eb8a-4078-83fb-a22a249ceb3b","resolution":{"observed_at":"2026-05-11T19:26:08.593021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04592","last_updated":"2025-06-06T04:08:17Z","snapshot_observed_at":"2026-07-06T18:26:54.963211Z","submitted_at":"2024-06-07T02:55:57Z","title":"Provable Complexity Improvement of AdaGrad over SGD: Upper and Lower Bounds in Stochastic Non-Convex Optimization","version":3},"cited_work":{"arxiv_id":"2406.04592","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04592","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provable complexity improvement of adagrad over sgd: Upper and lower bounds in stochastic non-convex optimization","venue":null,"work_id":"cdbc19d9-63d7-4304-9fc2-b65420a15f1d","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2406.04592","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:cae53d1e39b5d42fa8f40696701224af2affdd561e90a7a60548417f19e86bdf","observation_id":"7ee54a71-d2e5-47f8-929b-96ac55cfdafa","resolution":{"observed_at":"2026-05-11T19:26:08.606390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:4230c63ed4fabb7a2c8ade862e074b257ea3b87546a7d102ef04575fc3b8e30c","observation_id":"08cf0d11-a3bd-41b6-be38-ff7898efc49b","resolution":{"observed_at":"2026-05-11T19:26:08.580519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:046c466efc2fc347996fc8dce8d51fb955e1c9acc690b4b4ef6969235926b4fb","observation_id":"36fc57b1-e1fc-445b-9dbc-effb24ae7b67","resolution":{"observed_at":"2026-05-11T19:26:08.584831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-02T07:55:35.655526Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":"2304.13960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-07-03T23:59:07.455071Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":"8b55b951-9eb5-4661-944d-3ff7735beb98","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:7ae1c4775b1715c422e3ede682cf3de4024b850dd82c965e0d61f862fd72ebc6","observation_id":"f777e85e-7854-414a-a13e-ad3cc895b8ce","resolution":{"observed_at":"2026-05-11T19:26:08.565537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-07-10T21:57:38.615639Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:e897c2fe7b3b4d856b28d7ed7eae387aadce27ab1652c0d85be657c7b0d133bf","observation_id":"4ac87229-543a-4618-82ed-a76d92920cdc","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15244","last_updated":"2024-10-14T03:44:54Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T15:29:31Z","title":"AdaGrad under Anisotropic Smoothness","version":2},"cited_work":{"arxiv_id":"2406.15244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15244","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adagrad under anisotropic smoothness","venue":null,"work_id":"94bb6ea1-28c4-44e3-bea7-dfee267edc79","year":null},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2406.15244","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:5ea7b774ba5afdaf957d5203e3d15a90188d1611cb26090c85bb91a4ec382dda","observation_id":"20218c8c-a913-4081-90e6-74a40eeb76b6","resolution":{"observed_at":"2026-05-11T19:26:08.577041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":"1608.03983","doi":"10.21203/rs.3.rs-7055642/v1","metadata_source":"pith","pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","venue":"cs.LG","work_id":"ad476478-c5ea-495b-a454-168c504bbfcc","year":2016},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:1c0944b7740dfdfce7b2955c05c2755ecc035f2282281aa23ed4dd00c9ea7548","observation_id":"96edba34-090c-4e5c-b12d-8427fd30a166","resolution":{"observed_at":"2026-05-11T19:26:08.573133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:d1eb9a1f2c97e8990280a3ba4da7cd5197d38b42781ac19572fd2311f76c1906","observation_id":"4f098732-d3b8-4da8-b2ed-62c4bafda5c2","resolution":{"observed_at":"2026-05-11T19:26:08.600508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07097","last_updated":"2025-04-09T17:59:42Z","snapshot_observed_at":"2026-08-01T16:17:42.550877Z","submitted_at":"2025-04-09T17:59:42Z","title":"Sculpting Subspaces: Constrained Full Fine-Tuning in LLMs for Continual Learning","version":1},"cited_work":{"arxiv_id":"2504.07097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07097","snapshot_observed_at":"2026-07-02T12:36:56.945120Z","title":"Sculpt- ing subspaces: Constrained full fine-tuning in llms for continual learning","venue":null,"work_id":"ea02711d-672d-40e9-b679-eceb72a528a8","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2504.07097","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:3a8d8df754146132f03c19b5a6a9d2d851ff1c6982c3f9b7e7524fe591030b9f","observation_id":"f4527207-05ea-4dd8-9507-941d1a833de2","resolution":{"observed_at":"2026-05-11T19:26:08.634575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.17802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:25:39.566248Z","title":"Unbiased gradient low-rank projection.arXiv preprint arXiv:2510.17802","venue":null,"work_id":"1f71ca93-2c40-4170-8857-d1af388500ff","year":null},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:706c2aa5a251d902d62d5378861c0aa62875f97b8152a0d3805768e16076f543","observation_id":"1e85877e-44bc-4d15-a1a8-5749c9a97cc2","resolution":{"observed_at":"2026-05-11T19:26:08.558293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":"2502.07529","doi":"10.48550/arxiv.2502.07529","metadata_source":"pith","pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","venue":"cs.LG","work_id":"4f1b774a-8ada-4d79-a90b-520511fce5d0","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:10f3d3f3ed9edf71fb83a4070faaa8609acef1c9212ab7f4d408302f63b3757e","observation_id":"8de20694-9b62-4668-9ea0-79d4fddf3e94","resolution":{"observed_at":"2026-05-21T21:22:37.653978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"icarl: Incre- mental classifier and representation learning","venue":null,"work_id":"35219150-3a72-46ca-abfc-06591ab07c2c","year":2001},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:0ddc159e0c829083e7a7cd601e2f12c37b67dd646ebdd04aa197bd5d68b7a47f","observation_id":"f1f02a4f-4515-4026-a6d2-bd867ff84826","resolution":{"observed_at":"2026-05-26T13:47:25.028824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":"1904.09237","doi":"10.1016/s0893-6080(98","metadata_source":"pith","pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"On the Convergence of Adam and Beyond","venue":"cs.LG","work_id":"c727f303-212d-4d55-8c2c-19128e3c9c3f","year":2019},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:c02fad674ebacb3adf3c910eedfd11b0c248791b3d41445781b8da3a49b5e32e","observation_id":"7a950eec-14aa-4e47-ab6c-b8982a1f4b85","resolution":{"observed_at":"2026-05-11T19:26:08.480366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13627","last_updated":"2026-04-15T08:53:42Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T08:53:42Z","title":"(How) Learning Rates Regulate Catastrophic Overtraining","version":1},"cited_work":{"arxiv_id":"2604.13627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(How) Learning Rates Regulate Catastrophic Overtraining","venue":"cs.LG","work_id":"eb43b7c7-13aa-473e-ac68-12112acd59fc","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2604.13627","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:dc6bb9b2a79f55469907d6d843358c4802ac6e63a435c51f5a8c664508dea4e4","observation_id":"e69b531a-65e8-493c-9425-606bceeda5fb","resolution":{"observed_at":"2026-05-11T19:26:08.516618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-07-06T22:21:43.357115Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":null,"work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:fed11f78e796762f010336b824848621e525ddb78eb560c4bf622a454c99161a","observation_id":"c241f457-713a-41f8-9d3e-7a495da4d34b","resolution":{"observed_at":"2026-05-11T19:26:08.543311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-07-11T03:27:46.760869Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:dc1adb76b6aab820f1a6861af098cd76df981a416171f2c42c55b62ecb829c3e","observation_id":"fd97bb7d-23c4-4df2-b005-67030e28bb84","resolution":{"observed_at":"2026-05-11T19:26:08.625847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.21228","doi":"10.48550/arxiv.2410.21228","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Lora vs full fine-tuning: An illusion of equivalence","venue":null,"work_id":"64c35e8b-7441-4e1e-81d0-4c8b33204da6","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:a96aba812b7b20ed47800bd761da00841c34f9c7a48b1038d5c63830b4edd5eb","observation_id":"ee1c7cdd-d492-4dec-a458-30197356ce85","resolution":{"observed_at":"2026-05-11T19:26:08.547227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19206","last_updated":"2025-03-28T02:10:05Z","snapshot_observed_at":"2026-07-06T20:58:06.224759Z","submitted_at":"2025-03-24T23:11:56Z","title":"Overtrained Language Models Are Harder to Fine-Tune","version":2},"cited_work":{"arxiv_id":"2503.19206","doi":"10.48550/arxiv.2503.19206","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19206","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Overtrained language models are harder to fine-tune","venue":null,"work_id":"7809cd57-b457-491d-b50a-dbaaf8aef56b","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2503.19206","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:6585e6c9eb6585d8819bbfc634915d122bfcdcbc383fb4a3fbe7f88024756297","observation_id":"b97e7a15-a4d7-4248-9177-2ad6489cbcff","resolution":{"observed_at":"2026-05-11T19:26:08.539517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4862","last_updated":"2010-02-25T20:31:05Z","snapshot_observed_at":"2026-07-06T02:04:37.023313Z","submitted_at":"2010-02-25T20:31:05Z","title":"Less Regret via Online Conditioning","version":1},"cited_work":{"arxiv_id":"1002.4862","doi":null,"metadata_source":"pith","pith_arxiv_id":"1002.4862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less Regret via Online Conditioning","venue":"cs.LG","work_id":"564d428e-9b87-4f71-adfa-dab45e00bb16","year":2010},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1002.4862","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:7d35660c999ecaddb8704da7cd40f02f7df6216c5b6903e77eacd5bb6dde5f78","observation_id":"ab44dce8-7b8b-44cb-902e-4aa2bd1a0bc3","resolution":{"observed_at":"2026-05-11T19:26:08.508615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.165345Z","title":"ArXiv Preprint: 2511.00674 , Year =","venue":null,"work_id":"5e0fa664-f7a6-4ce3-934b-dd6d242ac7c6","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:9dd1537428740a67d00f29701fbedb78b7da569a0080fa0a9faaf6d98a391c80","observation_id":"1e3575ad-ab31-4b6d-8858-e9664cfd7ddf","resolution":{"observed_at":"2026-05-11T19:26:08.610339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:2b15991bb232dd27c448589b40110ed8ef6bd4bcf42f776de2ee5f0032c6132c","observation_id":"d8f36dc5-1a7a-4d95-a955-201b4894fdc2","resolution":{"observed_at":"2026-05-11T19:26:08.512185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":"2409.11321","doi":"10.48550/arxiv.2409.11321","metadata_source":"pith","pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","venue":"cs.LG","work_id":"65c9d9eb-0524-49bd-9aa5-2756ce24dc7f","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:6922e6d0d39a2e3560fefdc4c0dfdecea146f7188b7dc67ae530eba40c527445","observation_id":"29e05265-12eb-40cc-95fd-de75bd8b3692","resolution":{"observed_at":"2026-05-15T01:02:28.631723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.185587Z","title":"Muon outperforms adam in tail-end associative memory learning","venue":null,"work_id":"557e3d1a-f8b7-4fbe-9dc8-9432aa0bb507","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:5a20cbbfcf0f8965edf24d76c5102d51c3f0e672d4505623c0f1b24fd835f436","observation_id":"6a34c718-50c3-41dc-a453-89bed6c500bc","resolution":{"observed_at":"2026-05-11T19:26:08.554861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02120","last_updated":"2024-06-07T02:50:56Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:50:35Z","title":"Magicoder: Empowering Code Generation with OSS-Instruct","version":2},"cited_work":{"arxiv_id":"2312.02120","doi":"10.48550/arxiv.2312.02120","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02120","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Magicoder: Empowering code generation with oss-instruct","venue":null,"work_id":"1ea1e0ea-c781-4443-983d-cd560e111e59","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2312.02120","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:c26ec4d3a02b49dfd8974eb2c8471632d40ebe58b0deb0359e9cb676f2b97856","observation_id":"8347914b-4c3a-4e8e-aefe-e7d261dbc576","resolution":{"observed_at":"2026-05-11T19:26:08.655977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":null,"work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:115d98c2cad1345498af84be617dbccfdac555132656438e7c60b6820ae0f72a","observation_id":"fbb0ff62-ebc5-4ca2-8e0d-a4c89742f877","resolution":{"observed_at":"2026-05-11T19:26:08.470520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10537","last_updated":"2025-07-15T06:22:08Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T16:51:59Z","title":"Structured Preconditioners in Adaptive Optimization: A Unified Analysis","version":2},"cited_work":{"arxiv_id":"2503.10537","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10537","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structured preconditioners in adaptive optimization: A unified analysis.arXiv preprint arXiv:2503.10537","venue":null,"work_id":"b15e83a3-d996-4fb3-ab6b-f585a222bb3b","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2503.10537","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:b7810c07eb73d57e0474e5822a1b4bec0e333753332c43ccf03eece988268716","observation_id":"804a2766-31e4-49f3-92f5-fb3a064bf02b","resolution":{"observed_at":"2026-05-11T19:26:08.660083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.779389Z","title":"Controlled llm training on spectral sphere","venue":null,"work_id":"69f692bf-c6bb-45da-9428-f2f0a648156c","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:7e942794bbb80cbc939394570eddc78dfda700a0d58a8e915255dc2e3bc5b467","observation_id":"ccac7eb6-8554-4f1d-ba41-a2562d30ea4f","resolution":{"observed_at":"2026-05-11T19:26:08.531367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.719901Z","title":"On the width scaling of neural optimizers under matrix operator norms i: Row/column normalization and hyperparameter transfer.arXiv preprint arXiv:2603.09952","venue":null,"work_id":"a5de91e4-fa69-4278-ba7c-b1597e427196","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:3d53a1fe03c0d2f14c15c1e032fd34fd63cbdd81813fc00c8bc45425dc3e4f3c","observation_id":"c4701b1e-aca3-42f1-8db0-da32010a60c0","resolution":{"observed_at":"2026-05-11T19:26:08.475919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:ded5904eaa01932ac401a40310444d6edee25bb833bba6558a5662e7f2328c21","observation_id":"300a9d68-6a8e-4151-aa35-e275248e36ae","resolution":{"observed_at":"2026-05-11T19:26:08.629870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":"2310.17813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-07-03T00:27:30.167566Z","title":"A spectral condition for feature learning","venue":null,"work_id":"ea5e7b7c-3b11-439d-8d99-51b97d507821","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:920098d06cc4d6638acce1641a846b9a5dd3912493bf81e5850d563265ca8287","observation_id":"982ace06-fbed-4f02-b303-9cc6e2c4cdfa","resolution":{"observed_at":"2026-05-11T19:26:08.596926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":"1904.00962","doi":"10.48550/arxiv.1904.00962","metadata_source":"pith","pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","venue":"cs.LG","work_id":"206d2a89-691e-4467-8958-5630dacf4765","year":2019},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:fa00880a4eeb08c9747bb21895a91df92916bf9af672fd7b34c6a871b8c0be0b","observation_id":"d01d0395-cad3-4f9b-8c96-e98959813614","resolution":{"observed_at":"2026-05-21T21:39:00.104164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15416","last_updated":"2026-04-16T17:55:36Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T17:55:36Z","title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.15416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15416","snapshot_observed_at":"2026-07-04T10:09:44.609382Z","title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","venue":"cs.LG","work_id":"16171c61-28f7-494e-ab39-fdc10e7aeff0","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2604.15416","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:57668715505b4e1bfa36dd4774fc6586536c5cb7ac9bee9acc6e23effce167cb","observation_id":"06f3d469-ea31-425a-b541-7c6f1cd48023","resolution":{"observed_at":"2026-05-11T19:26:08.562081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":"2309.12284","doi":"10.48550/arxiv.2309.12284","metadata_source":"pith","pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","venue":"cs.CL","work_id":"e791a2f0-3b75-4c5b-84e1-d297d96e42f0","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:c3e3f7694ce4dd1e8304034a88750827df8b854a34ba06af761d601b557c4453","observation_id":"f9e4fb2e-0950-4211-b854-5b50d1359a24","resolution":{"observed_at":"2026-05-13T10:07:53.977132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:7232fd7a068b42366cc4483f565c97ef5bafd12c4c5940ef60b9857598f80665","observation_id":"538e25c1-2441-4600-8506-41ad000ad01b","resolution":{"observed_at":"2026-05-11T19:26:08.551157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-07-06T03:02:42.105044Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":"1212.5701","doi":null,"metadata_source":"pith","pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-07-03T17:08:43.610664Z","title":"ADADELTA: An Adaptive Learning Rate Method","venue":"cs.LG","work_id":"8cf4a28d-2b04-4146-9751-ac0d4ad61310","year":2012},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:071cfd193daa059d316096f9365e32847e3e8a832e543835bd2f52cd92cb1e3d","observation_id":"7998c599-731f-4125-89ab-d025e16f3398","resolution":{"observed_at":"2026-05-11T19:26:08.535605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":"2508.06471","doi":"10.48550/arxiv.2508.06471","metadata_source":"pith","pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-07-11T01:07:44.097694Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","venue":"cs.CL","work_id":"5bb4e5d7-985e-431b-bb0d-75576cdc2950","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:2680336f00e5e2e9d31b68919f8d92e50d697b35fde6e3085ad708d718d7ee81","observation_id":"a21fa863-90da-41e5-9bfa-ccd8459b71d7","resolution":{"observed_at":"2026-05-11T19:26:08.642431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":"1611.03530","doi":"10.48550/arxiv.1611.03530","metadata_source":"pith","pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Understanding deep learning requires rethinking generalization","venue":"cs.LG","work_id":"b260f96a-16f6-4936-8f3b-440917a19b34","year":2016},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:f2a4e09a66c294b32f97b0dc4f124d2312dadcf90cdd56e5b24e299652812506","observation_id":"2b360052-3f06-406c-91f1-0c3317a26c5a","resolution":{"observed_at":"2026-05-13T11:56:40.372790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":"2402.16788","doi":"10.48550/arxiv.2402.16788","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Yuan, J., Xie, F., Nie, F., and Li, X","venue":null,"work_id":"1dbea7ce-1a30-4c1b-a952-af4d80f6c7e0","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:bbd685332deb6907fc46095b6872d94464d9e12cdf428f9c9b9b24e3aac9a3e5","observation_id":"b7dff74f-a846-48eb-8e76-8b915e9acffc","resolution":{"observed_at":"2026-05-11T19:26:08.489778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":"2403.13372","doi":"10.48550/arxiv.2403.13372","metadata_source":"pith","pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-07-10T14:07:06.654437Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","venue":"cs.CL","work_id":"462b3287-e058-48e3-b5e3-82a5f2a8dc06","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:0cd7f613cb58dccaa209ee59000517ce9789b9464d73619e14fb701afdf3d4f3","observation_id":"9d9eb6cb-2630-4c13-a323-20ebf4406cca","resolution":{"observed_at":"2026-05-11T19:26:08.526331Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ee998b2-c4ad-42e9-bf74-40b673e52828","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:527872c1c455a2ed8efb0c399cb5277742c9c8697cf64760bca9f9802ff80182","observation_id":"34dcb554-30af-42cc-b424-357df4da4d06","resolution":{"observed_at":"2026-05-26T13:47:25.031255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Here, LoRA rank 64 shows a greater forgetting compared to rank 256, mainly because rank 256 diverges for lr=5e-4, and a smaller learning rate leads to less forgetting","venue":null,"work_id":"af196173-ab27-4583-a7b7-d4ae6d2d314e","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:00b1a90a11f97a51a3450977155139cfae0e0362c22f5b631b0e92dd6ab1f4e2","observation_id":"54569520-ba6a-4626-91be-97757a02b5b6","resolution":{"observed_at":"2026-05-26T13:47:25.025446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"103a8f39-5e40-4404-9b72-54d793d75f51","year":2000},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:d5ebdbf674f28816987a3a5e126e8c48e55b7a95321f5e6df4163601af73855a","observation_id":"581d67f9-75c1-41ff-b6eb-d653bb622d9a","resolution":{"observed_at":"2026-05-26T13:47:25.019542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"B.2 More Detailed Activation Plots In Figures 10 and 11, we present the average activation sparsity of detailed modules and specific ac- tivation splits","venue":null,"work_id":"a3e9440f-e587-4ae5-8df6-9f2b74999367","year":2000},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:c51402ab705b10ef2eea0999c6aa27b536020c5f6e90a0561dce054075574ee2","observation_id":"2469ed4d-f60e-4a5b-8514-9601ba82e64b","resolution":{"observed_at":"2026-05-26T13:47:25.016966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"23 •Ifα∈(α 1,∞], based on Lemma 2 and Assumption 4, it holds that ∥∆W∥ α1,β∗ ≤ ∥∆W∥ α,β∗ andE h ∥x∥2 α1 i = Θ E h ∥x∥2 α i","venue":null,"work_id":"53812a69-d2b7-4637-84ce-fd5095254881","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:db08fa21ba1b90a854b6963113f8c9315e669e503b19d538818f8cdd7e69b030","observation_id":"57ef95fa-30bb-4711-b3c2-176177269826","resolution":{"observed_at":"2026-05-26T13:47:25.022703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":2,"verified_exact":41,"verified_fuzzy":4},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2605.06654."}