{"as_of":"2026-08-14T11:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b4b4c4578ef2e32cd881d5f4ba38b2dc832bb5fac7d4132685cbfd34d631fe2","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T20:45:31.427677Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:38:09.654884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T22:38:10.015046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"cited_work":{"arxiv_id":"2409.04777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04777","snapshot_observed_at":"2026-08-04T22:38:10.015046Z","title":"Optimization Hyper-parameter Laws for Large Language Models","venue":"cs.LG","work_id":"0e5a00d7-d40b-47e3-a364-bf69cb0dde6e","year":2024},"citing_paper":{"arxiv_id":"2509.07238","last_updated":"2025-09-08T21:31:43Z","snapshot_observed_at":"2026-08-14T07:25:52.502774Z","submitted_at":"2025-09-08T21:31:43Z","title":"Systematic Optimization of Open Source Large Language Models for Mathematical Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:38:09.654884Z"},"links":{"cited_paper":"/paper/2409.04777","citing_paper":"/paper/2509.07238"},"observation_digest":"sha256:eab3c47b02997a5a5f51fc6c275c0d3c46fba470feb6f0ae94fb4fdc6dc4351e","observation_id":"238e251c-24b1-4d59-82da-23d5d43a8f14","resolution":{"observed_at":"2026-08-04T22:38:10.019370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2409.04777/citation-record","integrity":"/paper/2409.04777/integrity","json":"/paper/2409.04777/citation-record.json","paper":"/paper/2409.04777"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:1571a283a21b3a78da05a8fcd2c73096084535079f1d435053bd1cf0b55b9ff5","observation_id":"71b857a4-ad49-4b43-bbad-b05c7db2613b","resolution":{"observed_at":"2026-05-23T20:45:48.845085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:994526a4032eef0776850bbe20421819541a0dde76d86687996779ff5accaa14","observation_id":"899e10d2-4277-4c5c-8efb-a159e65415de","resolution":{"observed_at":"2026-05-23T20:45:48.840667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10102","last_updated":"2024-05-15T00:57:23Z","snapshot_observed_at":"2026-08-14T10:02:37.865381Z","submitted_at":"2024-04-15T19:19:56Z","title":"Chinchilla Scaling: A replication attempt","version":2},"cited_work":{"arxiv_id":"2404.10102","doi":"10.48550/arxiv.2404.10102","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Besiroglu, E","venue":"arXiv (Cornell University)","work_id":"1867d308-052b-4c44-a1e7-4ccc9ea2869b","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2404.10102","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:9562c7926a59e6e713cec5c0696c131df3803e7e97e7f813133986717dfcf8f7","observation_id":"9d989cec-7771-41d1-a130-01b1618bc8a9","resolution":{"observed_at":"2026-05-23T20:45:48.784575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T13:53:49.530466+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T13:53:49.530466+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:d0af308c359a12a859d248f5739438d6e7b9460efee628d58df18a2e08ed7e1f","observation_id":"f25b8a45-79ba-4bf4-89b6-dcda6f86d320","resolution":{"observed_at":"2026-05-23T20:45:48.804562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:09c9f7bfaeea6ddc3183c94b9e6c8ad867cf5f68bc79b51b5630fd93344d48a5","observation_id":"29fc9b2b-188c-4ba0-b630-2c8f205a7ad6","resolution":{"observed_at":"2026-05-23T20:45:48.854973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17386","last_updated":"2025-05-29T21:31:37Z","snapshot_observed_at":"2026-08-13T00:20:53.812414Z","submitted_at":"2024-04-26T13:02:20Z","title":"Stochastic Bregman Subgradient Methods for Nonsmooth Nonconvex Optimization Problems","version":3},"cited_work":{"arxiv_id":"2404.17386","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.17386","snapshot_observed_at":"2026-07-02T00:56:24.050133Z","title":"Ding and K.-C","venue":null,"work_id":"ccb35c64-fc4e-4c06-bc03-54e487a7e299","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2404.17386","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:0251ecb5a921fcfec4b6a8e90dc115e0328986e90737a9cb2fa781e99a783d12","observation_id":"acffcd64-5776-47f1-b1ba-7b4b07a12ea9","resolution":{"observed_at":"2026-05-23T20:45:48.814838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08858","last_updated":"2023-10-13T04:59:44Z","snapshot_observed_at":"2026-08-13T05:50:06.968091Z","submitted_at":"2023-10-13T04:59:44Z","title":"Adam-family Methods with Decoupled Weight Decay in Deep Learning","version":1},"cited_work":{"arxiv_id":"2310.08858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"41696ad5-18b6-46c6-92fc-7f5851a99281","year":null},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2310.08858","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:f67a62596c79e63ffeb4fcd5e236af3dc2836bf0b1204cfaec1a887d4b738371","observation_id":"99dd7265-15b3-4db5-bc31-bd10b8b39e89","resolution":{"observed_at":"2026-05-23T20:45:48.883210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:9d72a69b1e1bc97861bad2e5f9b204dd115c4f1c8b67b394c909c069d9cccea5","observation_id":"30383b20-e117-4d2a-a365-e88e3066d929","resolution":{"observed_at":"2026-05-23T20:45:48.867382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":"2010.01412","doi":"10.48550/arxiv.2010.01412","metadata_source":"pith","pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","venue":"cs.LG","work_id":"0f502a27-fa5d-459b-a595-548dc0691a9c","year":2020},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:2e55936a0930038c0a002e38fb0dc50c258f0fceb37965a50b169c673867c7b9","observation_id":"0d247a0a-72ab-4130-8a6f-053fc7e1a02d","resolution":{"observed_at":"2026-05-23T20:45:48.799977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03550","last_updated":"2024-11-06T10:19:32Z","snapshot_observed_at":"2026-08-13T12:49:22.669379Z","submitted_at":"2023-02-07T15:59:08Z","title":"Exponential convergence rates for momentum stochastic gradient descent in the overparametrized setting","version":2},"cited_work":{"arxiv_id":"2302.03550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.03550","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gess and S","venue":null,"work_id":"bf3299d2-87fc-4e78-8a00-da5e1bfe4952","year":null},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2302.03550","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:676179adee047636f34938a338fd74c7b3a1965e6a47be0cacf1960398c9e701","observation_id":"f97c4029-899f-445f-bcd8-352a29f3a66b","resolution":{"observed_at":"2026-05-23T20:45:48.872547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14045","last_updated":"2024-04-12T15:24:14Z","snapshot_observed_at":"2026-08-13T18:48:28.145420Z","submitted_at":"2024-03-20T23:57:38Z","title":"Accelerated Objective Gap and Gradient Norm Convergence for Gradient Descent via Long Steps","version":4},"cited_work":{"arxiv_id":"2403.14045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14045","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grimmer, K","venue":null,"work_id":"df18e5c1-d096-40c7-9046-5da7d82c4079","year":null},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2403.14045","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:e90e6a924e84c6ee54962e37ca1931ff32fd4474981eef6dc5e075460e6bc759","observation_id":"536f8344-1450-4939-bc2f-fd99b41393a1","resolution":{"observed_at":"2026-05-23T20:45:48.820443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14833","last_updated":"2024-06-27T08:11:01Z","snapshot_observed_at":"2026-08-12T23:37:51.679762Z","submitted_at":"2024-06-21T02:28:37Z","title":"Efficient Continual Pre-training by Mitigating the Stability Gap","version":2},"cited_work":{"arxiv_id":"2406.14833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14833","snapshot_observed_at":"2026-07-03T16:48:39.942516Z","title":null,"venue":null,"work_id":"a442239c-47d3-43a5-8580-eda90156ddae","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2406.14833","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:add9b5aa537a3a3717149c7afea47820e4eb1461ba8f393181b0956c5bed5974","observation_id":"dec96b09-c71c-48d9-a0f1-9a0f712cd44f","resolution":{"observed_at":"2026-05-23T20:45:48.778583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03459","last_updated":"2021-12-07T02:47:58Z","snapshot_observed_at":"2026-08-14T09:35:55.294620Z","submitted_at":"2021-12-07T02:47:58Z","title":"A Novel Convergence Analysis for Algorithms of the Adam Family","version":1},"cited_work":{"arxiv_id":"2112.03459","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03459","snapshot_observed_at":"2026-07-03T20:18:56.208375Z","title":"Stochastic first- and zeroth-order methods for nonconvex stochastic programming.SIAM Journal on Optimization, 23(4):2341–2368, 2013a","venue":null,"work_id":"20c26602-48c9-4d37-9181-a2c2151582ca","year":2021},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2112.03459","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:036bc010decad526a9fb14ad793de9b306f4dace785e52eabc0f0e7101d7e7df","observation_id":"3feba15a-7bca-4398-a3a3-68a93ee0a0ec","resolution":{"observed_at":"2026-05-23T20:45:48.831372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-08-12T23:55:55.131975Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:8cb7666db36c049b8ae1fc6191ea312904d0edc570c3cbe0998b3dad069d518e","observation_id":"5c6e8e3e-a02d-4d8b-959e-cbcb79d340f2","resolution":{"observed_at":"2026-05-23T20:45:48.861142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":"2102.01293","doi":"10.48550/arxiv.2102.01293","metadata_source":"pith","pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Transfer","venue":"cs.LG","work_id":"c58fc635-4090-4314-adf6-b45af9da58e5","year":2021},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:53e1ba56cc5317166c087185718427c9378bc7e382f8a1dde5e0d3d181cd6fda","observation_id":"58294b13-000a-4652-8853-27cc490a9b5d","resolution":{"observed_at":"2026-05-23T20:45:48.835986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:a9b8b51be9ae556dd33cd85cedb9b66a418253c8e11c1ce79afa950daa6d1ee7","observation_id":"6672f655-71d9-4a21-9daa-bfff810d6d1f","resolution":{"observed_at":"2026-05-23T20:45:48.808999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:b31e4e0628a253925a67c4bd911a885c9be6b54f0d521a1cbb5b1aec961bced8","observation_id":"778dbfa0-7a15-4bc5-93da-7da1272a3d8d","resolution":{"observed_at":"2026-05-23T20:45:48.795489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-14T11:04:35.135794Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":"2403.08763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-07-04T18:40:03.364876Z","title":"Ibrahim, B","venue":null,"work_id":"74c611cb-0d0e-46d7-8fa5-ad6a5196fa2c","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:005a79dea9ab5e2106edad6d4e0740e9fb2fc623de974ec4d70ca767730352c8","observation_id":"9d1a3c41-6262-40ba-8d3a-7e2dcbd5aa77","resolution":{"observed_at":"2026-05-23T20:45:48.824942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.04177","doi":"10.48550/arxiv.2402.04177","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling laws for downstream task performance of large language models","venue":"arXiv (Cornell University)","work_id":"ae81c291-4985-4e00-a40f-6f4b4abbc1f3","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:ec108b09420895bce1c4556649063b8137e1022421537642c790f850c185b2ec","observation_id":"2920b524-ea34-4253-a30c-c14534a6a0e9","resolution":{"observed_at":"2026-05-23T20:45:48.878109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04623","last_updated":"2018-09-13T09:29:55Z","snapshot_observed_at":"2026-07-06T06:09:11.794595Z","submitted_at":"2017-11-13T15:11:56Z","title":"Three Factors Influencing Minima in SGD","version":3},"cited_work":{"arxiv_id":"1711.04623","doi":"10.48550/arxiv.1711.04623","metadata_source":"pith","pith_arxiv_id":"1711.04623","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Three Factors Influencing Minima in SGD","venue":"cs.LG","work_id":"bcb52129-9115-4696-8926-64f96214f2d7","year":2017},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/1711.04623","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:b9fb48d0b9220b26f4d339b81b890d56f20819eec6a29188e6ae2200d4c9abc7","observation_id":"2a59b6c9-4c31-43e5-81db-eb207d1d272d","resolution":{"observed_at":"2026-05-23T20:45:48.790050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08859","last_updated":"2023-09-16T03:37:00Z","snapshot_observed_at":"2026-08-13T10:12:30.494660Z","submitted_at":"2023-09-16T03:37:00Z","title":"Rethinking Learning Rate Tuning in the Era of Large Language Models","version":1},"cited_work":{"arxiv_id":"2309.08859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.08859","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking Learning Rate Tuning in the Era of Large Language Models","venue":null,"work_id":"a08aa8b7-3361-49c4-960a-9299a3d6a6d9","year":2023},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2309.08859","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:88289fa0ff21acb7da03c1e366106e0f5d4cc0e8955c1fea78c5a01267e8a9fb","observation_id":"2821de96-b257-4f92-8b91-6275d9357eb6","resolution":{"observed_at":"2026-05-23T20:45:48.850073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:437237aa7a5d0dfad252fe59be8d8ab42f5bf9df7d5bb038564a8c3afd3da860","observation_id":"cee8d0b5-bf8e-47eb-af8b-71f0d9956ee6","resolution":{"observed_at":"2026-05-23T20:45:48.927406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03241","last_updated":"2023-04-12T10:36:44Z","snapshot_observed_at":"2026-08-13T13:17:05.603069Z","submitted_at":"2023-02-07T03:57:55Z","title":"Continual Pre-training of Language Models","version":4},"cited_work":{"arxiv_id":"2302.03241","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.03241","snapshot_observed_at":"2026-06-29T23:24:01.963863Z","title":"Continual pre-training of language models","venue":null,"work_id":"85c35e72-3c51-4386-adfd-a807084c08df","year":2023},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2302.03241","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:f4fb26cc43d293d87da69c523b7c88606d994e17abf923e1a1f597fda450b0e2","observation_id":"921063f1-6e6e-4ce5-8f3d-19c5d5d8f569","resolution":{"observed_at":"2026-05-23T20:45:48.948200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":"1609.04836","doi":"10.48550/arxiv.1609.04836","metadata_source":"pith","pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","venue":"cs.LG","work_id":"01efb355-7c12-4b89-bc42-91ee46ee276b","year":2016},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:36f573782a0e0386ea3caab635a49395e0f8261b1351845d944e627ea0e3d0f9","observation_id":"66668037-1846-4b0c-b002-81c88b430151","resolution":{"observed_at":"2026-05-23T20:45:48.922422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:0e3ed4290609378666896b047bcf4f36623cff044f6208743ea87e3827dbebf6","observation_id":"7cb45d94-fae8-4d42-9c33-cacdb13bfa97","resolution":{"observed_at":"2026-05-23T20:45:48.932968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:64b71e94fb58f676065d08e0a200d49ecc2b257beff9c8488a135dc421a558c0","observation_id":"68927d72-0c6c-41a1-bb77-4ef54908852b","resolution":{"observed_at":"2026-05-23T20:45:48.937948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09782","last_updated":"2024-06-06T13:22:26Z","snapshot_observed_at":"2026-08-13T11:15:20.665909Z","submitted_at":"2023-06-16T11:37:15Z","title":"Full Parameter Fine-tuning for Large Language Models with Limited Resources","version":2},"cited_work":{"arxiv_id":"2306.09782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09782","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Full Parameter Fine-tuning for Large Language Models with Limited Resources","venue":null,"work_id":"353b6558-5218-4e6b-990f-f033b7adb4ad","year":2023},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2306.09782","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:69142402708327a062f9c1894f8ffd1bafe89a6eda4bdba70f795e8608a4a581","observation_id":"671738de-d351-4a27-b967-585eccb6ef81","resolution":{"observed_at":"2026-05-23T20:45:48.888996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04562","last_updated":"2025-06-05T17:44:26Z","snapshot_observed_at":"2026-08-12T23:28:07.492301Z","submitted_at":"2024-07-05T14:53:32Z","title":"An SDE Perspective on Stochastic Inertial Gradient Dynamics with Time-Dependent Viscosity and Geometric Damping","version":2},"cited_work":{"arxiv_id":"2407.04562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maulen-Soto, J","venue":null,"work_id":"eb0f1666-d545-40d0-83c2-20a0454c600d","year":null},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2407.04562","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:4e66f971b26c0e36e7bdb2447ec952947967e624ca47f32073b0c35043bd32be","observation_id":"56eabdd4-9e51-49a5-9325-d982698991b5","resolution":{"observed_at":"2026-05-23T20:45:48.906059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-12T23:25:27.368960Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":"2407.07263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-07-03T16:38:40.742383Z","title":"Reuse, don't retrain: A recipe for continued pretraining of language models","venue":null,"work_id":"61784e94-998c-450a-93a4-550901ac1844","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:95d944f1b595b4c3319f440c54ec526ca2ac0d3d919fe8880e10979098d45bd1","observation_id":"0ba8aaa7-da0c-4ab4-81cd-3341c05d465c","resolution":{"observed_at":"2026-05-23T20:45:48.911815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:dc535508366db801774ba9253492328c84dbf607084473c2541550cd003c3083","observation_id":"f3b64c03-6053-4dbe-a6dc-f44a35ed181a","resolution":{"observed_at":"2026-05-23T20:45:48.971633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.17506","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.029951Z","title":"Rotaru, F","venue":null,"work_id":"dacb92f5-9f19-4323-b634-275a39e24867","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:3d3c7fa3689be6c8b9772e2adee6c64441092804de5f9b9ad5901e4867f21c19","observation_id":"3b89fc53-5457-4ee3-8787-2eabdaa4ee53","resolution":{"observed_at":"2026-05-23T20:45:48.894809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10998","last_updated":"2023-06-19T15:05:31Z","snapshot_observed_at":"2026-08-13T11:14:03.747692Z","submitted_at":"2023-06-19T15:05:31Z","title":"RepoFusion: Training Code Models to Understand Your Repository","version":1},"cited_work":{"arxiv_id":"2306.10998","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.10998","snapshot_observed_at":"2026-07-02T15:07:04.834474Z","title":"Shrivastava, D","venue":null,"work_id":"e901766e-f381-4aa1-be90-8ad514d9f551","year":2023},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2306.10998","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:5b7d11cbcf35c4e981a3885e8aacd410b4cc3c61b493b8cb15d2b10515bd6383","observation_id":"2e2cb812-1518-49a7-bfff-a1f2760f19ec","resolution":{"observed_at":"2026-05-23T20:45:48.953393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02750","last_updated":"2022-07-06T15:38:32Z","snapshot_observed_at":"2026-08-14T09:26:53.595673Z","submitted_at":"2022-07-06T15:38:32Z","title":"An SDE perspective on stochastic convex optimization","version":1},"cited_work":{"arxiv_id":"2207.02750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.02750","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e4889a79-71c5-4286-b2c1-7bbce7399123","year":null},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2207.02750","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:7f888af127a33609364cb494128efe297dcf14f8e9b3fe4e884a99bc89dbdb5a","observation_id":"b262fb87-6456-4f4c-a566-632f6612805f","resolution":{"observed_at":"2026-05-23T20:45:48.943058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05992","last_updated":"2023-01-15T00:06:37Z","snapshot_observed_at":"2026-08-13T13:04:17.670465Z","submitted_at":"2023-01-15T00:06:37Z","title":"An elementary proof of anti-concentration for degree two non-negative Gaussian polynomials","version":1},"cited_work":{"arxiv_id":"2301.05992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.05992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tu and R","venue":null,"work_id":"698bf233-3fdd-4595-86d1-2b59a82b8d95","year":null},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2301.05992","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:a5f0196ebe6c501f3e502370d0011b23720deac69ed458355d4eb96a128cdaff","observation_id":"9f78d267-bcdb-418d-99d7-86ab56a043d3","resolution":{"observed_at":"2026-05-23T20:45:48.961159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06563","last_updated":"2024-06-03T03:58:41Z","snapshot_observed_at":"2026-08-12T23:51:57.561105Z","submitted_at":"2024-06-03T03:58:41Z","title":"Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2406.06563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06563","snapshot_observed_at":"2026-07-04T20:00:09.047211Z","title":"Skywork-moe: A deep dive into training techniques for mixture-of-experts language models","venue":null,"work_id":"10e04da9-d662-49e0-a54b-e38c50d4a175","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2406.06563","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:ded2d2945ccae4bd1f78c2ad546f4125e4d0e3fe8bcd8204a036f6cf86f1bb26","observation_id":"733bf6a5-6cd0-414c-a0a7-c47f13c2bb89","resolution":{"observed_at":"2026-05-23T20:45:48.917769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10053","last_updated":"2026-08-08T16:05:24Z","snapshot_observed_at":"2026-08-13T23:09:33.034829Z","submitted_at":"2023-07-19T15:26:18Z","title":"Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization","version":5},"cited_work":{"arxiv_id":"2307.10053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10053","snapshot_observed_at":"2026-08-11T01:19:49.772953Z","title":"arXiv preprint arXiv:2307.10053 , year=","venue":null,"work_id":"ebf6510f-bd2c-4974-a78e-d66e351795fe","year":2023},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2307.10053","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:3f52133c349938cc081838538272199e7be3b08e46c310c63ce5ce3d4145e4f4","observation_id":"0f862a80-8a16-4d01-82d7-a0d843490679","resolution":{"observed_at":"2026-08-11T01:19:49.772953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04480","last_updated":"2024-11-29T08:38:55Z","snapshot_observed_at":"2026-08-14T05:35:51.615030Z","submitted_at":"2024-07-05T13:01:36Z","title":"LoCo: Low-Bit Communication Adaptor for Large-scale Model Training","version":2},"cited_work":{"arxiv_id":"2407.04480","doi":"10.48550/arxiv.2407.04480","metadata_source":"pith","pith_arxiv_id":"2407.04480","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoCo: Low-Bit Communication Adaptor for Large-scale Model Training","venue":"cs.LG","work_id":"c5e5e79f-4557-459c-bc74-bbd324cfc889","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2407.04480","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:48327a33f3422d16cd6098611288c0bebfc0d9e5cca90193e9b411b1b75f9d8b","observation_id":"770af79a-1280-4f19-9b18-16f11a657b15","resolution":{"observed_at":"2026-05-23T20:45:48.976479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.852762+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.852762+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:8e31672ce0f95a9dd6ecc1feac10f118e253652e14acf7bd813f291c85e85a4e","observation_id":"7c9da6ef-cfaa-4ab7-baab-3039495d370a","resolution":{"observed_at":"2026-05-23T20:45:48.981300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00605","last_updated":"2024-06-02T03:34:41Z","snapshot_observed_at":"2026-08-12T23:52:20.947175Z","submitted_at":"2024-06-02T03:34:41Z","title":"LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.00605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00605","snapshot_observed_at":"2026-07-04T10:59:46.629794Z","title":"Xinyu Zhao, Fangcong Yin, and Greg Durrett","venue":null,"work_id":"9087d278-600c-40a3-b0b0-faf434902d5b","year":null},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2406.00605","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:41d9b5f8e4872f5674de8cbcce1c79950820d4f727bd5af5b5823c89ad68933c","observation_id":"6ea7a178-6fbc-4f44-8eed-c145524dd004","resolution":{"observed_at":"2026-05-23T20:45:48.900983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":39,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2409.04777."}