{"as_of":"2026-08-07T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f9e5ae16fdbb2e83d1ca020dd3bb16387fc4d13a128ddf69661c637cee4867f","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T17:44:44.438637Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.04418/citation-record","integrity":"/paper/2605.04418/integrity","json":"/paper/2605.04418/citation-record.json","paper":"/paper/2605.04418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.01306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards a principled Muon under µP: Ensuring spectral conditions throughout training","venue":null,"work_id":"fb228f7e-4435-4248-a3d4-c1cd4e0a6a39","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:8aceef02cf712658a92060a3eb283a53b16b25003ad0afd987c59cec040852e9","observation_id":"2edf1d9a-72ea-4f0c-ba09-bb40edbef06b","resolution":{"observed_at":"2026-05-11T17:16:08.929972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e2e9cfa1-f8d3-4779-b7d4-7a3f80f85335","year":null},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:f71e3c7185a7a9b6ed20411ea7d861a0c3d5836cb107ca35d8ce8f481c31cb7b","observation_id":"f363a3d0-b430-4554-b7a5-3da65af97e6a","resolution":{"observed_at":"2026-05-26T06:51:52.483921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14315","last_updated":"2026-05-28T12:56:57Z","snapshot_observed_at":"2026-08-02T07:50:35.119827Z","submitted_at":"2026-03-15T10:16:40Z","title":"Enhancing LLM Training via Spectral Clipping","version":2},"cited_work":{"arxiv_id":"2603.14315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.14315","snapshot_observed_at":"2026-07-02T12:16:57.336174Z","title":"Enhancing LLM Training via Spectral Clipping","venue":"cs.LG","work_id":"4400c96e-60a6-4f56-80c0-e29b1585b7d9","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2603.14315","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:c8875d1ad8b8f8304fd90413e0d1cc8088f0ec8321d69379da2f0ff41b423b3e","observation_id":"6b2fe08c-42bf-40ee-9555-ed2f704d64ed","resolution":{"observed_at":"2026-05-29T03:04:38.016704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning in transformers under spectral constraints","venue":null,"work_id":"efe915b5-f370-4f27-bf2e-793643d12699","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:b7daa445a5f529dc5d9ce1fb62c2f68cd4459794210630c493513112c33a92bb","observation_id":"7d1f369c-b63c-4a95-a88d-1a8628111b1f","resolution":{"observed_at":"2026-05-26T06:51:52.475747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.23000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.822162Z","title":"Gu and Z","venue":null,"work_id":"63c619b0-e2c2-4a9c-9dfe-0e4b03073c40","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:04e6233ccc90be1e80977a72ca26c24abe284a2cabf50a75b1427897e1bd967c","observation_id":"dc75a3c6-2f8e-49b5-b814-69e58bd4b179","resolution":{"observed_at":"2026-05-11T17:16:08.921338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preston Hess, Franz Cesista, Andrii Zahorodnii, Jeremy Bernstein, and Phillip Isola","venue":null,"work_id":"285b3d45-9abf-47b2-b93d-8627a33cbb8b","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:66fcff5281e8000d3899571cd430ebdd135f3aa3e4b2f96121da7fbcb00ef83f","observation_id":"22bbd0f4-7dd4-4051-9246-b3fbd7fe5b99","resolution":{"observed_at":"2026-05-26T06:51:52.480067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.779389Z","title":"Controlled llm training on spectral sphere","venue":null,"work_id":"69f692bf-c6bb-45da-9428-f2f0a648156c","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:5ec15e7246ccb413a4d57c57f11273a12f3434e6727a9bf491991278cfd991ad","observation_id":"1f2fdbb4-9694-4761-a904-6566ee8eaba6","resolution":{"observed_at":"2026-05-11T17:16:08.934741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:48:21.420602Z","title":"Yang and L","venue":null,"work_id":"2204e902-32f2-4ef3-906e-0625a2e3fe2b","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:535e8e237aee5a909ff384fbe1d00f66e39b1372d045f32d003fa32d8c5e91ba","observation_id":"c71b0d1e-814f-4c4c-8bd7-5c74bc985cbb","resolution":{"observed_at":"2026-05-11T17:16:08.587142Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.161381Z","title":"Hewa Koneputugodage, Shamane Siriwardhana, Violetta Shevchenko, Karol Pajak, James Snewin, Gil Avra- ham, and Alexander Long","venue":null,"work_id":"78a2a00f-c96a-4386-bd4f-0583ed7ffe26","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:5837ff8f85bd331aeacc4e56d7744ce75607e9b2e6344c901cc1e9a6e748b1a5","observation_id":"7865ece1-9e1a-4d14-8173-720d484dd899","resolution":{"observed_at":"2026-05-11T17:16:08.645451Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastest descent on a manifold: 4","venue":null,"work_id":"edce4c4b-5b34-41b9-983d-7921ec20414a","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:e1298e82fce6e139f0a6d18e9de5d757b1be3615223a038cbae7e7d92900254f","observation_id":"a68b708f-6fc0-4b99-a6b3-d9af5b393a12","resolution":{"observed_at":"2026-05-26T06:51:52.439194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastest descent on a manifold: 2","venue":null,"work_id":"1e4bd477-362d-4113-8774-79eea4583b62","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:7d52606ce1240876fdc81de351b1451ed1fff849f2633db06fc27b4dd3eeef0b","observation_id":"09c41a83-192e-49b8-aa89-3722763acba5","resolution":{"observed_at":"2026-05-26T06:51:52.435441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fantastic pretraining optimizers and where to find them 2.1: Hyperball optimization, 12 2025","venue":null,"work_id":"7bbb3022-8483-4a0c-a501-09cd9cd2385a","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:c9f49b5019db52ce6ca7d97812e2d0edb1387f46031a75c622e868110ce5a240","observation_id":"0793d9ef-d358-48d7-9729-98e6aa61d848","resolution":{"observed_at":"2026-05-26T06:51:52.423926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:54:19.899514Z","title":"20251026","venue":null,"work_id":"47dbfacb-ba1e-4993-a8cb-0a77adc5933c","year":2020},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:0dccdef9192829790103c4e21c0f9d829260b55283bfd930150c9cbe8c195537","observation_id":"e266651a-8234-43d9-bcf9-5ab41df08fd8","resolution":{"observed_at":"2026-05-08T17:53:53.527487Z","resolver_source":"doi","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:f73c46fcd123fd8e6061045efac1660dc3fec63b9493683a6755ef4adc2387b9","observation_id":"408581a2-dc72-411a-84f1-8420598191c5","resolution":{"observed_at":"2026-05-11T17:16:08.881578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-07T11:24:41.113349Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:f6e9bfd9083ba0d2b86b3ccf56a9e4e58c6791d05ac65df16152a2b8014053a4","observation_id":"366a7266-7668-49cf-a79c-f180b3c32392","resolution":{"observed_at":"2026-05-11T17:16:08.661283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17212","last_updated":"2024-06-03T15:57:47Z","snapshot_observed_at":"2026-07-06T15:34:09.163519Z","submitted_at":"2023-05-26T19:14:01Z","title":"Rotational Equilibrium: How Weight Decay Balances Learning Across Neural Networks","version":4},"cited_work":{"arxiv_id":"2305.17212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17212","snapshot_observed_at":"2026-07-04T20:30:07.614249Z","title":"Rotational equilibrium: How weight decay balances learning across neural networks","venue":null,"work_id":"d82eedaa-2305-4283-b22a-afb56d1edeea","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2305.17212","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:0e96328813a3bc7ac1d16c4dc50db54ba2cdec1227acbb7cbc64d78115abea48","observation_id":"f9631de9-1045-4c3f-8e86-bec4201236ff","resolution":{"observed_at":"2026-05-11T17:16:08.501233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11152","last_updated":"2024-08-16T10:36:24Z","snapshot_observed_at":"2026-08-05T07:19:57.879412Z","submitted_at":"2020-11-23T00:39:49Z","title":"On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective","version":6},"cited_work":{"arxiv_id":"2011.11152","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.11152","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the overlooked pitfalls of weight decay and how to mitigate them: A gradient-norm perspective","venue":null,"work_id":"626f6ae0-a2ef-40cd-bf24-1ad631f8ef50","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2011.11152","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:a3675b01433b38db8b924e13dddf508c3aefe8a211eef73ed4be1181b7b41d78","observation_id":"14948cf7-0c8f-4a68-bcee-0d11c06b91ab","resolution":{"observed_at":"2026-05-11T17:16:08.810342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04415","last_updated":"2024-11-04T23:21:13Z","snapshot_observed_at":"2026-07-06T16:28:55.209047Z","submitted_at":"2023-10-06T17:58:21Z","title":"Why Do We Need Weight Decay in Modern Deep Learning?","version":2},"cited_work":{"arxiv_id":"2310.04415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.04415","snapshot_observed_at":"2026-07-04T20:30:07.694373Z","title":"arXiv: 2310.04415 [cs.LG].url:https://arxiv.org/abs/2310.04415","venue":null,"work_id":"c97a49ec-f435-4fcd-812a-ac270ff17004","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2310.04415","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:a6d2bac4f6d2881881969ecd34de04bbaaec5d4d613e09d33966c3bedcc8f51a","observation_id":"2072564f-7d72-4eee-ade2-ba9051136fb3","resolution":{"observed_at":"2026-05-11T17:16:08.583373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muon: An optimizer for hidden layers","venue":null,"work_id":"0c1482a1-e450-4e55-baad-e85ad9575b56","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:25282dda90aaa558d759a101b9073bc151f2c267e421297f8c2514437765d314","observation_id":"bb710117-a561-487c-83a4-55310c6ed413","resolution":{"observed_at":"2026-05-26T06:51:52.427948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lower bounds for non-convex stochastic optimization.Mathematical Programming, 199(1):165–214","venue":null,"work_id":"4b7b7601-c041-4fb5-8269-b79d5b18b79e","year":2023},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:27803abdf93b4f12cd982cb9f11a0fae41ab36a747b177dcde678c0860cb0e86","observation_id":"8bc50449-f5c9-4c5d-be18-6bc338bcc274","resolution":{"observed_at":"2026-05-26T06:51:52.420028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":"2310.17813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-07-03T00:27:30.167566Z","title":"A spectral condition for feature learning","venue":null,"work_id":"ea5e7b7c-3b11-439d-8d99-51b97d507821","year":2023},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:db734b91ff1eaef2a900a2df00319b0f0c03314536eed646e1267105e32e3a5f","observation_id":"e9ff0d42-59cb-4e8a-967f-d52b207404a4","resolution":{"observed_at":"2026-05-11T17:16:08.473359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond MuP: 2","venue":null,"work_id":"d90730e6-68b7-478d-ae6e-a22b5d569157","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:cbe6f69a26bd0cc9ecc43f12c56a0d77969de8550b601c9863d3ab1034ab2a24","observation_id":"44824dad-55d7-438a-a2e5-9d09348ef448","resolution":{"observed_at":"2026-05-26T06:51:52.447800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Limit of the smallest eigenvalue of a large dimensional sample covariance matrix.Ann","venue":null,"work_id":"ce7b0812-a379-4117-95d5-32dc5498f76a","year":1993},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:7101275b22bf0f5b684cc913ee009658ce7de57aecf258d57fd19303897c979c","observation_id":"b5ba9518-75ad-40c0-aac7-d3693c1d75df","resolution":{"observed_at":"2026-05-26T06:51:52.460611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-07-06T04:08:54.419941Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":"1502.03167","doi":"10.48550/arxiv.1502.03167","metadata_source":"pith","pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","venue":"cs.LG","work_id":"05484516-8937-4cdf-9176-7f8329ef0221","year":2015},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:dd30f3b3b5af867d424c72e9c2e9a963bdc606d58e37a9e1d48641397b4365d5","observation_id":"7cb0bbc8-4f33-4882-85d8-26a019ad4572","resolution":{"observed_at":"2026-05-13T17:19:17.426681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.990281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.990281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Group normalization","venue":null,"work_id":"ea56e0b6-4235-4460-bd2e-256a1d88a11e","year":2018},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:333a284c426a28028a4f6ce969cdc00143b2eef7010d13023b87682f04813d5a","observation_id":"bb793abc-6fc0-4d81-8b62-60b442c81c24","resolution":{"observed_at":"2026-05-26T06:51:52.472002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:e4b45dcd49b1e369692f57603566db2959318982465f5e97b611a03e6e7c56df","observation_id":"36e054fb-1769-4e98-9536-d10b7e8f6890","resolution":{"observed_at":"2026-05-11T17:16:08.531365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07868","last_updated":"2016-06-04T01:21:52Z","snapshot_observed_at":"2026-08-07T09:38:21.553275Z","submitted_at":"2016-02-25T10:13:45Z","title":"Weight Normalization: A Simple Reparameterization to Accelerate Training of Deep Neural Networks","version":3},"cited_work":{"arxiv_id":"1602.07868","doi":null,"metadata_source":"pith","pith_arxiv_id":"1602.07868","snapshot_observed_at":"2026-07-04T20:30:07.758419Z","title":"Weight Normalization: A Simple Reparameterization to Accelerate Training of Deep Neural Networks","venue":"cs.LG","work_id":"80ae5268-393e-40dd-9d1f-574b8467643a","year":2016},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1602.07868","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:804058a160316baa63ba50cafe350f5c2a265696faaef00fd564c7eb5e68d109","observation_id":"ae70157d-5f2d-4c1d-bfe9-d20607f06a27","resolution":{"observed_at":"2026-05-11T17:16:08.617421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.10520","last_updated":"2020-08-09T21:25:15Z","snapshot_observed_at":"2026-08-07T12:52:43.992391Z","submitted_at":"2019-03-25T18:00:05Z","title":"Micro-Batch Training with Batch-Channel Normalization and Weight Standardization","version":2},"cited_work":{"arxiv_id":"1903.10520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1903.10520","snapshot_observed_at":"2026-07-04T20:30:07.793995Z","title":"Micro-batch training with batch-channel normalization and weight standardization","venue":null,"work_id":"7fb77fff-0abf-4eeb-a6c7-7f777bca76c7","year":1903},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1903.10520","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:518d53b263c32e71195f04461cf7750070bb440f252c8ed46cc3ea62379fd4ab","observation_id":"334cb2e1-6280-4a31-9dfc-11adcb15a98b","resolution":{"observed_at":"2026-05-11T17:16:08.558335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":"1910.07467","doi":"10.48550/arxiv.1910.07467","metadata_source":"pith","pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Root Mean Square Layer Normalization","venue":"cs.LG","work_id":"2e813694-442c-4650-ba76-478100469518","year":2019},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:04f5330966397f5e5c20ea968833800a8b330b3fafeedaf8268337540943d0e3","observation_id":"4e385f67-8ece-466f-b8ec-66c37519b53e","resolution":{"observed_at":"2026-05-17T18:45:27.296410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04454","last_updated":"2024-04-05T23:56:50Z","snapshot_observed_at":"2026-08-02T00:31:00.932110Z","submitted_at":"2024-04-05T23:56:50Z","title":"Implicit Bias of AdamW: $\\ell_\\infty$ Norm Constrained Optimization","version":1},"cited_work":{"arxiv_id":"2404.04454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.04454","snapshot_observed_at":"2026-07-04T13:29:51.056750Z","title":"and Li, Z","venue":null,"work_id":"bce3ed2e-85c9-4af2-8202-762b2a896d0f","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2404.04454","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:ca1d8f66e1d2946cfd9e9bf6c31eec853eb6af1093ef66288462db7e00b4a1c2","observation_id":"70d3bedb-7961-485e-ae56-7cf0911f4c85","resolution":{"observed_at":"2026-05-11T17:16:08.510347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02916","last_updated":"2020-10-06T17:58:29Z","snapshot_observed_at":"2026-07-06T10:02:02.340983Z","submitted_at":"2020-10-06T17:58:29Z","title":"Reconciling Modern Deep Learning with Traditional Optimization Analyses: The Intrinsic Learning Rate","version":1},"cited_work":{"arxiv_id":"2010.02916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.02916","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconciling modern deep learning with traditional optimiza- tion analyses: The intrinsic learning rate","venue":null,"work_id":"d0f28f5d-4ecf-493e-87e4-c3623d2d2c40","year":2020},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2010.02916","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:8dd986cd537b41d66ef4aea014f054b376294b253026caac3d4992f15bc0fa1e","observation_id":"47cd698e-528b-448b-ab5d-ba04040821ef","resolution":{"observed_at":"2026-05-11T17:16:08.775984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The rotation of eigenvectors by a perturbation","venue":null,"work_id":"811d0041-49df-432e-a79d-576fd3057c42","year":1970},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:81d1391617360793252f59abc4e26bb7c0d18b80df41b8a7909fe4661a211876","observation_id":"5f9d1096-05ab-4e6d-bdc3-a93e902870d3","resolution":{"observed_at":"2026-05-26T06:51:52.431721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perturbation bounds in connection with singular value decomposition.BIT Numerical Mathematics, 12(1):99–111","venue":null,"work_id":"5a09f49f-aded-48af-b656-98f12e39043c","year":1972},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:176d0b178f8cf5d1d61530201998ae7fcfd3c0d6027e49977dc4787ab2ae0eda","observation_id":"e748474a-95c1-462a-81d1-fa0e49ab9f9f","resolution":{"observed_at":"2026-05-26T06:51:52.452135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":"2502.07529","doi":"10.48550/arxiv.2502.07529","metadata_source":"pith","pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","venue":"cs.LG","work_id":"4f1b774a-8ada-4d79-a90b-520511fce5d0","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:211609602f6333a6d3ad2d9cf58a083cd1b644085126492afe8a6595faa4bbf4","observation_id":"3fe219d6-5dc0-4e13-85ce-631291a4c87f","resolution":{"observed_at":"2026-05-21T21:22:37.653978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:22:34.690733Z","title":"Purifying shampoo: Investigating shampoo’s heuristics by decomposing its preconditioner.arXiv preprint arXiv:2506.03595","venue":null,"work_id":"d7470ec8-6598-49e9-b9b8-facac50fd641","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:3680de8bfd8311e05923745b33293c6b8d18f08357381042fd925ac9d12c3129","observation_id":"c3efc946-0e67-4b2a-95b0-aae07c5a574a","resolution":{"observed_at":"2026-05-11T17:16:08.684182Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:52:45.097761Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"21bd27c1-c23e-4b16-9b92-81a1a1564e2a","year":2018},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:fc0eaa8d6ae2044bbd9e5425da3e838492d14a1f3bdadd28f851b9aa97332e49","observation_id":"3d19e898-3c75-41c9-b9ce-e4ba2158a845","resolution":{"observed_at":"2026-05-26T06:51:52.395672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:45:00.380052Z","title":"Eschenhagen, A","venue":null,"work_id":"cb2ed6f0-569a-4972-881c-b347ad80b389","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:29460230fdee20fb15ca2cc03bfb5f7382e925a6fc417e376436b40bbb52b3d2","observation_id":"00ad15c4-bcf3-460e-90f7-e35711778238","resolution":{"observed_at":"2026-05-11T17:16:08.493123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-05T09:31:11.684666Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":"2309.06497","doi":"10.48550/arxiv.2309.06497","metadata_source":"pith","pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2309.06497 (2023)","venue":"cs.LG","work_id":"12f3e87b-1374-4a12-943c-42087610a1a6","year":2023},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:90a561018488a746d17a50164cdc9e60375c81f39d47528ccfba1896c52eefbf","observation_id":"f7799bca-5bf9-4092-bb26-3a19778cd3b2","resolution":{"observed_at":"2026-05-11T17:16:08.604600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:c64adb56009d850d33a9e55bf3144c882b5912cb4761deeacc011e94beba530a","observation_id":"24dc1065-dee6-4fa2-b3b5-d68d9e0649c8","resolution":{"observed_at":"2026-05-16T07:27:53.041705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.20762","doi":"10.48550/arxiv.2503.20762","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asgo: Adaptive structured gradient optimization.arXiv preprint arXiv:2503.20762","venue":"arXiv (Cornell University)","work_id":"96cc3325-c45a-429a-b585-8fbba970e8f2","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:7d4a5ddddee00eba123217a39cd79b5f66d478ced53265bbac9258d4bccf4c76","observation_id":"48ba7c26-ab2f-4df0-9f6b-61b279f49ebc","resolution":{"observed_at":"2026-05-11T17:16:08.902107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-07-06T20:08:43.596697Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":"2412.13148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-07-04T14:29:54.502956Z","title":"SWAN: SGD with normalization and whitening enables stateless LLM training","venue":null,"work_id":"5560d104-9f68-42bf-805d-593cbfa60d87","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:0ab0a11bab3927e8971df7a8f7eca100085dc29e4c2cce0726630433ed9aa358","observation_id":"a7c1ad9e-fe70-49b7-82be-fedba31a45a1","resolution":{"observed_at":"2026-05-11T17:16:08.611550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"cited_work":{"arxiv_id":"2506.16659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16659","snapshot_observed_at":"2026-06-30T18:45:00.461346Z","title":"Glentis, J","venue":"cs.LG","work_id":"5bba5d3c-48d9-4024-b45e-e085759c9b84","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2506.16659","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:cd2e0140a997b8c86e88117361c777c75e735d44316ebc551cceba40dff90a97","observation_id":"eeca4c05-e80d-49d1-9015-de8493d9bb24","resolution":{"observed_at":"2026-05-22T02:03:26.475417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.719901Z","title":"On the width scaling of neural optimizers under matrix operator norms i: Row/column normalization and hyperparameter transfer.arXiv preprint arXiv:2603.09952","venue":null,"work_id":"a5de91e4-fa69-4278-ba7c-b1597e427196","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:67c3ee876413fb3bb2004a4182f619f9262e0538de71eb2b67eda552ee4d7062","observation_id":"391ef415-473d-4a19-8e64-4f451a34688e","resolution":{"observed_at":"2026-05-11T17:16:08.724980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":"2502.06742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient multi-normalization for stateless and scalable LLM training.arXiv preprint arXiv:2502.06742","venue":null,"work_id":"09b4549a-f5c8-443c-9f1e-8b81edc247fa","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:2ab9058160e4a3837f645c21551f8c6f9efcf66805cb4ae9349775f9d6edf637","observation_id":"903bcba7-1617-42cb-b2b1-21f27dad111d","resolution":{"observed_at":"2026-05-11T17:16:08.860137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spectral normalization for generative adversarial networks","venue":null,"work_id":"2a16cfc1-0927-4a45-a802-5e329d8a8545","year":2018},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:c523b3d3d968df33ca0065d606232d244bc21d88ccbb199eee65c2ca8ad85e5d","observation_id":"c0860afa-dc5a-4f18-8b2f-e6378657ab43","resolution":{"observed_at":"2026-05-26T06:51:52.406703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.07227","last_updated":"2021-09-18T19:50:39Z","snapshot_observed_at":"2026-07-06T10:41:14.357966Z","submitted_at":"2021-02-14T19:30:40Z","title":"Learning by Turning: Neural Architecture Aware Optimisation","version":2},"cited_work":{"arxiv_id":"2102.07227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.07227","snapshot_observed_at":"2026-07-04T20:30:07.767596Z","title":"Learning by turning: Neural architecture aware optimisation","venue":null,"work_id":"95c34c5b-e99c-489c-b759-7037b09cc6ec","year":2021},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2102.07227","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:8db423c4dcf352eaf8a3de9e0a8b50ee2b81e0d02d1b523fbdcd96a53e8f15f9","observation_id":"9c39cf46-d2e2-42c4-ac89-ef64fe7c6322","resolution":{"observed_at":"2026-05-11T17:16:08.654531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01131","last_updated":"2025-04-23T18:41:43Z","snapshot_observed_at":"2026-08-03T18:00:51.343975Z","submitted_at":"2024-10-01T23:50:09Z","title":"nGPT: Normalized Transformer with Representation Learning on the Hypersphere","version":2},"cited_work":{"arxiv_id":"2410.01131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01131","snapshot_observed_at":"2026-07-04T20:30:07.817010Z","title":"ngpt: Normalized transformer with rep- resentation learning on the hypersphere","venue":null,"work_id":"5e4725ed-8f81-4635-8bc9-df1e5537947c","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2410.01131","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:f647d66bd2bf227d2cfe3e0b9548936df64ad9fec2b0ed1c056c2bf32134aa8e","observation_id":"2f6df2fc-544a-4582-b3a9-75b4789c61fe","resolution":{"observed_at":"2026-05-11T17:16:08.766353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18890","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.772744Z","title":"Nemotron-Flash: Towards latency-optimal hybrid small language models","venue":null,"work_id":"6674423f-eb4a-4b6c-b3a8-bfabba863a8c","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:20850fa41e14fcd9aa011652e7351138a431776193982bec2a8ba9cc201fbeb5","observation_id":"ecdaad71-b785-4e3c-8e5a-6fb3a020a2d9","resolution":{"observed_at":"2026-05-11T17:16:08.431827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.733597Z","title":"Franke, Urs Spiegelhalter, Marianna Nezhurina, Jenia Jitsev, Frank Hutter, and Michael Hefenbrock","venue":null,"work_id":"f930bcff-2b5f-4b24-8242-76b33d2c1bc1","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:d7ed598948df7f4106a8e9f686c4c5bce5c0069b7d1de75c9b002ebe480505bb","observation_id":"f7620bf9-b3b5-48b4-b6da-ae9a753636bd","resolution":{"observed_at":"2026-05-11T17:16:08.818862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spherical motion dynamics: Learning dynamics of normalized neural network using SGD and weight decay","venue":null,"work_id":"7c90e506-5e92-4342-82ab-89b48f53143b","year":2021},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:59f67e75ade27879816d9b055e4d9cf1739c2121753b47091e73a278b9c1c117","observation_id":"19052610-360e-42db-adb7-926ec3095fc3","resolution":{"observed_at":"2026-05-26T06:51:52.415246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rehg, and Le Song","venue":null,"work_id":"dbdcaef6-75df-4431-bd75-ab73246e9dd8","year":2018},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:2095213f85365a73b07452d4eba6349ed8fe745dc377cba551245f9bfb1eaf9c","observation_id":"a156c684-80ab-49d3-92e0-910006558488","resolution":{"observed_at":"2026-05-26T06:51:52.387715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial kuramoto oscillatory neurons","venue":null,"work_id":"18428d61-8bfc-474c-be82-17de40f3686f","year":null},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:711e34826b412ef31a265d0131066bf66f6f852e4f26c6affe1ab8cba7021b2a","observation_id":"66bf8d64-5567-40e0-ac50-ee0dc73278b5","resolution":{"observed_at":"2026-05-26T06:51:52.464755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13821","last_updated":"2025-05-16T19:02:59Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:47:54Z","title":"Artificial Kuramoto Oscillatory Neurons","version":3},"cited_work":{"arxiv_id":"2410.13821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13821","snapshot_observed_at":"2026-07-04T20:30:07.755382Z","title":"Miyato, S","venue":null,"work_id":"89f32632-14a8-48c9-a1d4-951f7427d30d","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2410.13821","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:ab0d9341db6e864bf8090696c00f8c24b2c092fb1f4423f70b2b18856f281765","observation_id":"6c3cb6b5-e020-4d53-8d77-4a8c21c5713e","resolution":{"observed_at":"2026-05-11T17:16:08.449352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":"03149da6-618b-4690-be5c-e18e273d2652","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:c5ca9be226580715f3e24c8a2e722375a61691073da9eeb9d49301fa71c56697","observation_id":"dd5bd31f-d93b-4f95-adca-ea91093cc2d2","resolution":{"observed_at":"2026-05-26T06:51:52.391753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17500","last_updated":"2025-03-21T19:23:08Z","snapshot_observed_at":"2026-08-07T16:45:03.337316Z","submitted_at":"2025-03-21T19:23:08Z","title":"Variance Control via Weight Rescaling in LLM Pre-training","version":1},"cited_work":{"arxiv_id":"2503.17500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17500","snapshot_observed_at":"2026-07-04T20:30:07.761002Z","title":"Variance control via weight rescaling in LLM pre-training","venue":null,"work_id":"a25d2642-9536-4a4c-b9d8-907e9de1d3ab","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2503.17500","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:2015a9df88f0aab91d96ce003e05e35782158539ad933517950d354ff40a19c5","observation_id":"72d77f85-8ffc-44fc-a565-78f10d6dac32","resolution":{"observed_at":"2026-05-11T17:16:08.623547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12281","last_updated":"2018-10-29T17:51:25Z","snapshot_observed_at":"2026-07-06T07:11:16.512397Z","submitted_at":"2018-10-29T17:51:25Z","title":"Three Mechanisms of Weight Decay Regularization","version":1},"cited_work":{"arxiv_id":"1810.12281","doi":"10.48550/arxiv.1810.12281","metadata_source":"pith","pith_arxiv_id":"1810.12281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Three Mechanisms of Weight Decay Regularization","venue":"cs.LG","work_id":"12729858-0e60-4a34-b5f4-a7be84b94b30","year":2018},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1810.12281","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:9cae7b3170249777937115b5206a133fa067cbe6fc41dc3234934afae7330f96","observation_id":"7ada0e78-bf35-4a2f-84dd-d1be243ebf2f","resolution":{"observed_at":"2026-05-11T17:16:08.907128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00089","last_updated":"2022-01-31T21:00:55Z","snapshot_observed_at":"2026-08-05T03:35:36.834328Z","submitted_at":"2022-01-31T21:00:55Z","title":"Understanding AdamW through Proximal Methods and Scale-Freeness","version":1},"cited_work":{"arxiv_id":"2202.00089","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.00089","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding AdamW through proximal methods and scale-freeness","venue":null,"work_id":"3d254392-6d47-408e-9e8c-e5c5f3f73423","year":2022},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2202.00089","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:a5e8650dfb125a3d73c0209fdf4d93326d8865bba9e111c34f9cd14189cc079d","observation_id":"daee681e-3656-4608-8807-bb987c87a5bd","resolution":{"observed_at":"2026-05-11T17:16:08.793766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07454","last_updated":"2019-11-21T11:01:34Z","snapshot_observed_at":"2026-07-06T08:30:04.777443Z","submitted_at":"2019-10-16T16:22:58Z","title":"An Exponential Learning Rate Schedule for Deep Learning","version":3},"cited_work":{"arxiv_id":"1910.07454","doi":"10.48550/arxiv.1910.07454","metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07454","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhiyuan Li and Sanjeev Arora","venue":"arXiv (Cornell University)","work_id":"83da90a5-e133-42ac-b393-76e279843d54","year":1910},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1910.07454","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:3509218c4f113ad36fff9104eb2919c334c2d18201790c9d44fc4424c116fe30","observation_id":"c6751a95-31bf-4211-9702-2f6b1432e5dc","resolution":{"observed_at":"2026-05-11T17:16:08.896788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08217","last_updated":"2021-01-18T14:36:15Z","snapshot_observed_at":"2026-07-06T09:29:05.834368Z","submitted_at":"2020-06-15T08:35:15Z","title":"AdamP: Slowing Down the Slowdown for Momentum Optimizers on Scale-invariant Weights","version":3},"cited_work":{"arxiv_id":"2006.08217","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.08217","snapshot_observed_at":"2026-07-04T20:30:07.569978Z","title":"Adamp: Slowing down the slowdown for momentum optimizers on scale-invariant weights","venue":null,"work_id":"849d5273-034d-40d7-96c6-07ff9d59eb66","year":2021},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2006.08217","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:3b1f93d585206322c59886c7c98e568ee68160450a9196bd7decf570d7a29b99","observation_id":"546e3c95-58fc-4962-bf6e-5719fd4409ba","resolution":{"observed_at":"2026-05-11T17:16:08.579398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05350","last_updated":"2017-06-16T17:08:08Z","snapshot_observed_at":"2026-08-06T22:03:25.581947Z","submitted_at":"2017-06-16T17:08:08Z","title":"L2 Regularization versus Batch and Weight Normalization","version":1},"cited_work":{"arxiv_id":"1706.05350","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.05350","snapshot_observed_at":"2026-07-04T20:30:07.604801Z","title":"L2 Regularization versus Batch and Weight Normalization","venue":"cs.LG","work_id":"17e14df7-cc67-4fa7-b09c-4bc22ea9e76a","year":2017},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/1706.05350","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:bc1f754e246ae96e5397856035d8b377dd5e1bcfdd7812545dcd9e56e0ae0514","observation_id":"dec1ef61-f772-48cb-bf0d-2377857ca165","resolution":{"observed_at":"2026-05-11T17:16:08.747351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23922","last_updated":"2024-10-31T13:32:39Z","snapshot_observed_at":"2026-08-03T12:33:12.983704Z","submitted_at":"2024-10-31T13:32:39Z","title":"Analyzing & Reducing the Need for Learning Rate Warmup in GPT Training","version":1},"cited_work":{"arxiv_id":"2410.23922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23922","snapshot_observed_at":"2026-07-04T20:30:07.747085Z","title":"Analyzing & reducing the need for learning rate warmup in GPT training","venue":null,"work_id":"2b312276-6b85-481b-8ef8-7fa1ba298c84","year":2024},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2410.23922","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:266dc242dcc109da4f7d2768bf18d1b503b9b00a6009ca2af4d4f7396e7521c4","observation_id":"9aac8c65-2157-402a-bbc4-ac7fd291b559","resolution":{"observed_at":"2026-05-11T17:16:08.665048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond MuP: 4","venue":null,"work_id":"e900c634-8c5d-490a-a7cb-556eb4239d81","year":2026},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:0d99956a627b750fade256cb99ce15616f71d2050dc482c1e29964881a3d0655","observation_id":"3c1c9885-2ef3-443e-8c19-ed4a7fab8d88","resolution":{"observed_at":"2026-05-26T06:51:52.410667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05898","last_updated":"2025-07-01T15:59:19Z","snapshot_observed_at":"2026-07-06T16:29:55.892584Z","submitted_at":"2023-10-09T17:41:29Z","title":"Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts","version":7},"cited_work":{"arxiv_id":"2310.05898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05898","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lion secretly solves constrained optimization: As lyapunov predicts","venue":null,"work_id":"2c0ebc66-48e7-4adf-a728-3a2a1b5d9bdf","year":2023},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2310.05898","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:94e395281b18966e6e5c892a53dd08c099c5297bf8b35d940a50fbe4d0d7778c","observation_id":"a02ed98c-dee5-4f21-936c-a708ea5cda0f","resolution":{"observed_at":"2026-05-11T17:16:08.459960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nonsmooth analysis of singular values","venue":null,"work_id":"ed4b014a-3701-47fa-acfe-6de5f573eb18","year":2005},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:e45a8535c1935b8331919d00b5d0e3f3cfe71194ffd0bc828a04ac37d4a1c059","observation_id":"59619866-3f41-4ff0-bbd6-f0b3aca06c2a","resolution":{"observed_at":"2026-05-26T06:51:52.468444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smooth manifolds","venue":null,"work_id":"9ca43e98-3a76-4fcd-856b-04f11cfd970d","year":2003},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:59fc1f714b825f137b73f5c619d1f6425ba36345d8f98365fda9933523069ad5","observation_id":"e32bee35-8c6c-4881-abc1-4986194f55a8","resolution":{"observed_at":"2026-05-26T06:51:52.374880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Horn and Charles R","venue":null,"work_id":"22c461be-551e-4665-9ef7-cb1a29cec69d","year":1991},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:fa5cfcf6ba5573b1054388fc33f228c45060b557222bb3c42d5ac2b50321c41b","observation_id":"624c48f3-62de-4947-b5fa-fa88bc301705","resolution":{"observed_at":"2026-05-26T06:51:52.443871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sampling from large matrices: An approach through geometric functional analysis.Journal of the ACM, 54(4):21:1–21:19","venue":null,"work_id":"84b169f7-0eca-45e3-b3b0-cc7ca3899ac0","year":2007},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:fc4240d8a4bb86b4bd037ad6068c1431aab7036cc3d4bce7b61ecaa125c4f497","observation_id":"4838c6c9-1d05-4331-a2ba-9975bdd1d3d3","resolution":{"observed_at":"2026-05-26T06:51:52.379789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9e0a1516-505b-4e7c-beab-b86f76e51862","year":1990},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:b6048bf746a6eeb6f59205e4ad57579a09a299abf6d90b6e74eecf66969dfbfe","observation_id":"160ea377-4666-486d-a381-b738a460bcb2","resolution":{"observed_at":"2026-05-26T06:51:52.399856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NanoChat: The best ChatGPT that $100 can buy","venue":null,"work_id":"909fcda0-8905-4713-b902-7e2063f7da3a","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:51aa6545c1478835fddc2ea6c86b918deae849eac6d9ec8bbbdbf46854c7eaae","observation_id":"4fd66625-00d3-4658-8957-93eab7134f17","resolution":{"observed_at":"2026-05-26T06:51:52.384014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive Rotational Equilibrium under Spectral Sphere","venue":null,"work_id":"026a57c2-30fb-4df6-a9a7-b14d095e54dc","year":2000},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:d4962e830d2e677f5a6b51f054e21c69fa77064305f740c70286b349a5796bf3","observation_id":"84743629-e181-4906-b22c-3c96fc17f218","resolution":{"observed_at":"2026-05-26T06:51:52.456276Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":2,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":2,"verified_exact":32,"verified_fuzzy":24},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2605.04418."}