{"as_of":"2026-08-06T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11ba5fb950acd4ebc14c4b1a4a9086937e74273384d04ef05a79e2504ca49bf7","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T19:56:54.047126Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:14:12.034776Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T20:30:07.719081Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"cited_work":{"arxiv_id":"2605.26895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.26895","snapshot_observed_at":"2026-07-04T20:30:07.719081Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","venue":"cs.LG","work_id":"e25b9806-5dc5-4d9b-b83c-a43d97e2e0b3","year":2026},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/2605.26895","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:51d9a8fb681f99060cf1b8f5203b9173e80f4ad61267a4a8592eda6483499386","observation_id":"5ccad840-ac3a-4815-864f-33ebe42ec849","resolution":{"observed_at":"2026-07-04T20:30:07.720403Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26895","snapshot_observed_at":"2026-08-02T10:14:12.034776Z","title":"Negligible in size, significant in effect: On scale vectors in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:12.034776Z"},"links":{"cited_paper":"/paper/2605.26895","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:03cac1f25e406a4cbe689b3c36139d44fc48258a09d7247491efa9718bd38bd2","observation_id":"85f586ff-f2a5-42b6-89f4-830783f91b0d","resolution":{"observed_at":"2026-08-02T10:14:12.034776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.26895/citation-record","integrity":"/paper/2605.26895/integrity","json":"/paper/2605.26895/citation-record.json","paper":"/paper/2605.26895"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"On the optimization of deep networks: Implicit acceleration by overparameterization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:037fd0b0e030da8fc88de7f4570ac9aa52582955d3be1a07fdf9204d0cb9a389","observation_id":"f6d6abf6-c617-43bd-99f5-e0a0db965c59","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:960a4e6fca3c0ec4c256fc5c696b246d79e4781f9c5f82aa6598a2f2983e4b02","observation_id":"be1ed8c9-061f-47e1-8c2b-2fa5736ea1c1","resolution":{"observed_at":"2026-06-29T20:03:56.377843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Optimization methods for large-scale machine learning.SIAM review, 60(2):223–311, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:cfa775f7ee9caed139da6b0b739c24f111b354aa62ef3b525b77433e8b6668a9","observation_id":"7740af1e-5abc-4fa9-ab43-027344c3c110","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:03:56.390925Z","title":"Seednorm: Self-rescaled dynamic normalization.arXiv preprint arXiv:2510.22777, 2025","venue":null,"work_id":"ea8cc570-01f2-4aaa-87e6-c92bc5351580","year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:46044cad5dbc24270a5970a421713e4f32a84a975f60db5aefa93b52251b74a8","observation_id":"73c0ad59-05ac-41fc-aef6-a8cf0d736575","resolution":{"observed_at":"2026-06-29T20:03:56.392947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:03:56.353248Z","title":"Post-layernorm is back: Stable, expressive, and deep.arXiv preprint arXiv:2601.19895, 2026","venue":null,"work_id":"c209a9c2-f39e-44f1-a5e9-40481812071c","year":2026},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:e9abd84082a9f5a3ffc427183f7e0d98084aded43a36fade50b2b35ec4932e3c","observation_id":"c24cae3c-4c71-49f5-bb39-cd4dbb4baa3b","resolution":{"observed_at":"2026-06-29T20:03:56.354792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Label noise SGD provably prefers flat global minimizers.Advances in Neural Information Processing Systems, 34:27449–27461, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:997420255c8c97deb285b2c0af6391b086f02bd9005614c86c687487541861f1","observation_id":"a0381982-7521-4446-a942-06f7f078b0d3","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:dbf2ea995eec26108f14b1812fdcd3d6c17eb5ca9f70af1af2805da3043a51ed","observation_id":"563167d2-5db2-4da5-97c5-274a4b6bcf0c","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"The inverse variance–flatness relation in stochastic gradient descent is critical for finding flat minima.Proceedings of the National Academy of Sciences, 118(9):e2015617118, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:d06fa5d2a8f447e4a4f4bb0341c3ea123c6b1c33a05a8f96410e8ae62ff985f1","observation_id":"aad33d69-f219-4309-9bc4-20206e40352d","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:485241da90e1d68d7b332913fb7d490e748777be21b28517176a4b9b022748f6","observation_id":"aa54f2e4-338c-4884-a997-1a193ffbe27a","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Shape matters: Understanding the implicit bias of the noise covariance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:724c81e6de67dc75e3ded5ee4580042329aa1699a3eaba8cf86f67986b043b08","observation_id":"fe55fa24-f041-4dd1-9ed0-1e0cf2177635","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Introduction to online convex optimization.Foundationsand Trends®in Optimization, 2(3-4): 157–325, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:82ab87af8649363e21eee10bdb63bcb457f9b560ee12e6764983fb5c1c5735da","observation_id":"be4249ca-42b4-40b0-bd1c-8f5e91ffe824","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:9caa3476b1dd9f2bdea792e9284f9c1486180a213ed17c1efd99b050c049365c","observation_id":"6c3e6461-6baa-48d5-bbc6-9586e4540a15","resolution":{"observed_at":"2026-06-29T20:03:56.389862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:2bebcf863a8e0f257d7b438563ae37b9028879fb70ddaefb73712442091ad701","observation_id":"8086825e-b5f4-4692-b21d-3ce67c91b14d","resolution":{"observed_at":"2026-06-29T20:03:56.367612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-07-06T04:08:54.419941Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":"1502.03167","doi":"10.48550/arxiv.1502.03167","metadata_source":"pith","pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","venue":"cs.LG","work_id":"05484516-8937-4cdf-9176-7f8329ef0221","year":2015},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:ca8b64ba4048aecc594aac489f8dc057b10745703005a1ea679a68b61c8ce46d","observation_id":"4f71305d-73b7-4d70-882e-fca01f58e58b","resolution":{"observed_at":"2026-06-29T20:03:56.360360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.990281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.990281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:da9899513dc1dda60b4ae074d0f129e3003184653352d81379aab301437eec10","observation_id":"e5b62692-d2c3-4f98-9aad-1a19e2bd022a","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Muon optimizer.URL https://github.com/KellerJordan/Muon?tab=readme-ov-file, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:5539390ef9ac4183805242e2af5ff07c7f9e6d4b7620c9842b7e916b1058513c","observation_id":"7fa44733-cacf-498b-899e-a32e52f58720","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:7736dc658251058335f449691bfc93e5b12ae9c5648496ac29ee4ff62365e8f5","observation_id":"b0795519-9065-46c4-9819-74de45bd95e2","resolution":{"observed_at":"2026-06-29T20:03:56.387598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Stochastic modified equations and adaptive stochastic gradient algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:3f6b9ab75613008fd7a262ce8d5b11229f37851c3f26bf7ced5a99c3f87e7ec7","observation_id":"e762af73-3c2d-4a56-aa4e-20f81ae699a5","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"What happens after SGD reaches zero loss?–a mathematical framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:066b1de207a5cd4f87dadc3c4d0ca17d814a4e0570a119618243b0f05cdc4e5c","observation_id":"3802c18e-7dd9-4db0-a8fd-24a9e2427693","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:9caf9a71dc011add408542924ee76d593ea4a8f1b79bc4719f256e9224f17307","observation_id":"2d697157-3b3d-4a0d-84ea-dae74da3b441","resolution":{"observed_at":"2026-06-29T20:03:56.382885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Noise and fluctuation of finite learning rate stochastic gradient descent","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:739b641b3535f4f207d3048daab186c3841f2b3af31d07a4ad4ab0addbce6039","observation_id":"ccd897ff-7d7d-4b49-916b-c6a55070a280","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:922aee1a9ed14b5c0e8b4e216e1d0cfd4f2362a584aafe993290ed860d49355d","observation_id":"2eee105d-aa22-4d74-a3f1-9c07e298930e","resolution":{"observed_at":"2026-06-29T20:03:56.362868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:fde9daf9913347401377404a76922468438450dbb9b17cd62acde1b63cc2e9f1","observation_id":"8bdfbc38-ee2b-4c5d-a588-e30c4a66f3f1","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09557","last_updated":"2022-01-29T14:48:50Z","snapshot_observed_at":"2026-07-06T11:11:09.086170Z","submitted_at":"2021-05-20T07:25:07Z","title":"Power-law escape rate of SGD","version":2},"cited_work":{"arxiv_id":"2105.09557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.09557","snapshot_observed_at":"2026-06-29T20:03:56.371256Z","title":"Logarithmic landscape and power-law escape rate of SGD","venue":null,"work_id":"5e106b48-f8d0-4ab0-9fdc-d7a2de378495","year":2021},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2105.09557","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:c5058cee40e489fef03754c430374bdb773a1978c5257b0232890a1e9c42d7b4","observation_id":"229fa5f6-b91b-4260-b47b-b7cfe68eb540","resolution":{"observed_at":"2026-06-29T20:03:56.372698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Power-law escape rate of sgd","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:dda92f72c64b0dc49fd4dd0105b41151d09af076839ca77ca90ae78edea73b56","observation_id":"43dc79a1-f30a-4837-8e97-59f363d273e7","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Transformers without tears: Improving the normalization of self-attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:8a6539c890dc4ab893388be0951b67c8b6f2011fff472f3e4b2602c7d9fbb868","observation_id":"a20dea62-5991-4a16-9724-79f52a353b8b","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":"2501.00656","doi":"10.48550/arxiv.2501.00656","metadata_source":"pith","pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2 OLMo 2 Furious","venue":"cs.CL","work_id":"9ef0dc2b-fdfe-4f14-b235-ef7556dc709a","year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:e3bbbbf9191b864b96a1853c1c62a7de37982f1da82ac82806e4b76fdd1473d6","observation_id":"86de0c30-2a11-40e6-8cd7-179624a610be","resolution":{"observed_at":"2026-06-29T20:03:56.370226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:03:56.347448Z","title":"A unified view of attention and residual sinks: Outlier-driven rescaling is essential for transformer training","venue":null,"work_id":"3ce13d97-005a-41e8-9585-ee7be8b11b6a","year":2026},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:bbbed728e12bce157b5665ea64c1619ef6c18072ec63f35733a1cb00f8b7325b","observation_id":"6d02f29f-e9e8-4d49-926c-a25aca2057fd","resolution":{"observed_at":"2026-06-29T20:03:56.348937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Non-convex learning via stochastic gradient langevin dynamics: a nonasymptotic analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:a23179d776430bdd4b1e6f2757b4e2b2e6ebd5f9e1c3f3f90f07a8f37d6f04f5","observation_id":"bc063411-3758-4471-bda5-d7e09e89a366","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks.International Conference on Learning Representations, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:0f27f3b807289e8b78263fa29cb43f7e88de42ad039fe5ea05e011f51f7efb20","observation_id":"781a9a10-2291-4cab-94c9-b55e86dea0ba","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:c4396a92a666e541fb612a2db6a814a39b60b0d92d824b067d92eaa0ac8b2ebc","observation_id":"fa631fa3-04d9-462f-8e79-a12d46d152ca","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:d261d30e85250c0fdcc6b700052301e8280440e0723d376f1867c2d417973e19","observation_id":"f8152584-9a2d-4647-9b51-e1493635dfdb","resolution":{"observed_at":"2026-06-29T20:03:56.357522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:500bcd4c46e49c58300d277a19ab00983b56ee9265ed4417638477d8aeafb976","observation_id":"ac12bede-7af8-429f-a75e-bdeab9238f83","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Tieleman and G","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:c666f176db90bdf933d03cd816db3cfc9924ec048c651cd5d928035f504915b8","observation_id":"f9400ecb-df4b-4eb8-9543-5a1a02d9ed55","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:56d87073ad7b1aa619abef192fe2954d2d43eee4c2d66eb6469b46450cdd944a","observation_id":"8ef7b968-45f8-458c-b16f-d722427c8cc0","resolution":{"observed_at":"2026-06-29T20:03:56.365142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Attention is all you need.Advancesin neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:cb3b6af29c1ba8eaf42cce1960ae1b79a9203eecc00448931345e76415d5c2a3","observation_id":"9f20bf04-4300-44b0-8ac3-b13f92c56f58","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Soap: Improving and stabilizing shampoo using adam for language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:bf3a447a61fda60beaa109605c652f6670fb673b708e4d7c479d27e297fe26aa","observation_id":"c5524de1-3089-4f4f-89b7-d32b035335e4","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Deepnet: Scaling transformers to 1,000 layers.IEEE Transactionson Pattern Analysis and Machine Intelligence, 46(10):6761–6774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:b2c4106088362a635f755da373321599af7f203dcef98d63390fca5a99e809b0","observation_id":"f927861a-c287-4f22-8414-a935da506baf","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training.International Conference on Machine Learning, pages 64859–64879, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:3dadfd370630f2412d58d9e7a4cc60c983a817e884ea1634defd014af47ef78f","observation_id":"c6ce5507-9cde-4779-b69e-f99be7ff6771","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Gradpower: Powering gradients for faster language model pre-training.International Conference on Machine Learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:df80f1b5ecde2f0560895fc10c1b17edf5be37a2a0a867ebf1292873b3ddffc4","observation_id":"e6704bdd-adb1-4559-a6db-bb215eefb6bf","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00692","last_updated":"2024-02-01T11:15:37Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T14:58:20Z","title":"A Theoretical Analysis of Noise Geometry in Stochastic Gradient Descent","version":3},"cited_work":{"arxiv_id":"2310.00692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00692","snapshot_observed_at":"2026-07-02T07:06:44.921064Z","title":"and Wu, L","venue":null,"work_id":"a257a27f-7f84-456e-9d49-600d4d5ae60e","year":2023},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2310.00692","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:04cdff27110d02d73a9209e90122bb1a26c463f5ca8f0354f5be94a62753b765","observation_id":"21d359c4-b7af-48de-9e93-613595c7e38c","resolution":{"observed_at":"2026-06-29T20:03:56.375366Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Improving generalization and convergence by enhancing implicit regularization.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:d90e16ecab7e1162f509857258eba248994f41d6774c13b43879e3481e330c05","observation_id":"492f1ed6-efa2-4daf-823c-e2410eff2bad","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Bayesian learning via stochastic gradient langevin dynamics","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:667749808935e000e55fb5b144e037386a64b31d629bc9aa2389677bd086c616","observation_id":"cf9f3de2-31a2-420c-bd45-26326b1cff4a","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02588","last_updated":"2021-09-15T02:42:33Z","snapshot_observed_at":"2026-07-06T11:16:03.019800Z","submitted_at":"2021-06-04T16:34:32Z","title":"Stochastic gradient descent with noise of machine learning type. Part II: Continuous time analysis","version":2},"cited_work":{"arxiv_id":"2106.02588","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.02588","snapshot_observed_at":"2026-06-29T20:03:56.378860Z","title":"Stochastic gradient descent with noise of machine learning type","venue":null,"work_id":"a6dd5aab-4b16-4db8-9d9f-467e781bce36","year":2021},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2106.02588","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:47de0321e015453dc75792b385edd7e3015f2acb3291d1d735d1f025d0f410b6","observation_id":"832087ea-8f8e-47c5-bc71-c2ec5f8c04b1","resolution":{"observed_at":"2026-06-29T20:03:56.380331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"The alignment property of sgd noise and how it helps select flat minima: A stability analysis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:841a462d6c2d76b46bc6c30e0ff091aec4016569163254958c2781f38620e6e6","observation_id":"a5ca6b9c-f9f9-4c65-b800-16c329c1264c","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:b9b81e2549db208f834416a391042454ed98f39dc13ee63371a6cfdec8feb5c7","observation_id":"a0d7d435-572a-49e8-9dec-ddf14da7dabd","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:90b01b8e8f1d70f8b4437a9b68670fe2b9221cf59af089bc4067db559cef6ef2","observation_id":"a64532f0-4ff0-4ae7-b228-00a36c377464","resolution":{"observed_at":"2026-06-29T20:03:56.385040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:3ae08f3097ffb84aae51e6a92f755427b57aa18459df5b22849c33b8395efda9","observation_id":"2224e8a4-c0cb-4f8f-b368-d9ab2f785c05","resolution":{"observed_at":"2026-06-29T20:03:56.351806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Scaling vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:4a07ab2fc24b4e31afebbd64c496895a7962a7d22d9260107cbf7c72f4e7bd31","observation_id":"6445e9cd-4947-42aa-ad06-3609600da68a","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Root mean square layer normalization.Advancesin Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:95173808d782127062d1a9da9d4bb5f8111ea3b2fe85e7ec3150651b4b985157","observation_id":"ea413e91-d95c-498c-95b7-d2863b9f0c20","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Transformers without normalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:6e5ea4933f6dd41a2ff09c13652a6d447cb3dfa3340dd5dd11c5616c82aa30d2","observation_id":"b3b3fa41-7013-45d3-b3c8-b746c5dfed62","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.137309Z","title":"arXiv preprint arXiv:2602.22681 , year=","venue":null,"work_id":"a4ad176e-d8f6-4dfb-a868-35f0093833da","year":2026},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:fb7f0b07112aec8215ecf3eca325e2a02dd714ce14f9af4c670d9d3d1c829509","observation_id":"b8333a4a-3b2d-479b-9b98-5206ef6a6822","resolution":{"observed_at":"2026-06-29T20:03:56.343296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.04598","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:29:02.646734Z","title":"HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization","venue":null,"work_id":"0e755e4b-9baf-4b33-a332-2ec0a9dcdca8","year":2025},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:fdc1053a9e1371feb48883d2102aaa2d641547c101fa2a6291002185ce08fd5c","observation_id":"b67ff9bd-9274-440b-812b-594310558c26","resolution":{"observed_at":"2026-06-29T20:03:56.345993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Parameter symmetry and noise equilibrium of stochastic gradient descent.Advancesin Neural Information Processing Systems, 37:93874–93906, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:368e822be9953d39cd109358064249e0006521f9a159aa0839c48c6660358a0a","observation_id":"3a4233b1-3f6a-4b7e-8454-87f75ec667cc","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:56:54.047126Z","title":"Sincew=0π-a.s., we also have a=γ⊙w=0π-a.s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T19:56:54.047126Z"},"links":{"citing_paper":"/paper/2605.26895"},"observation_digest":"sha256:100d3d223f36839c89133c7df4508f96690cb908fc16820599d84b0673454019","observation_id":"92c2c495-d03c-4e03-b568-cdf8b149eb2e","resolution":{"observed_at":"2026-06-29T19:56:54.047126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26895","last_updated":"2026-05-26T11:56:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T08:53:30.147473Z","submitted_at":"2026-05-26T11:56:49Z","title":"Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":19,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2605.26895."}