{"as_of":"2026-08-08T02:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c8eab9a9b161dd153b39d2da8979006dd8bd3366c478dcd90cc3129d6b961cd","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:57:29.278658Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:10:49.683444Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T16:41:06.415113Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"cited_work":{"arxiv_id":"2506.01049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01049","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tam- ing llms by scaling learning rates with gradient grouping","venue":null,"work_id":"5ebd7558-1c13-46ea-9f13-769f09415621","year":2025},"citing_paper":{"arxiv_id":"2605.05794","last_updated":"2026-05-07T07:32:27Z","snapshot_observed_at":"2026-07-30T14:24:32.368109Z","submitted_at":"2026-05-07T07:32:27Z","title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:51.611115Z"},"links":{"cited_paper":"/paper/2506.01049","citing_paper":"/paper/2605.05794"},"observation_digest":"sha256:cad24edfdc559637b4f108a0d23977cb8118803a958993129d728e7424304bf0","observation_id":"39b37602-eb7a-4980-b4a0-f8e3a6ae7eb7","resolution":{"observed_at":"2026-05-11T16:41:06.419261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01049","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Taming llms by scaling learning rates with gradient grouping.arXiv preprint arXiv:2506.01049, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2506.01049","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:c3744b2a4840b4851865e09eca79b6334a9fcc15b099cc4062b41641b8da60c1","observation_id":"b1e36740-728e-47b1-8590-2f2aeec73c55","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01049/citation-record","integrity":"/paper/2506.01049/integrity","json":"/paper/2506.01049/citation-record.json","paper":"/paper/2506.01049"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.960786Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.960786Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:4c5ce7635f3022b3260e7647e6c1031cfd994ea89a6b30362df16e14e59d68b1","observation_id":"0963deb6-c74b-4b8c-80b6-ca00a44c6488","resolution":{"observed_at":"2026-08-07T11:57:28.960786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.965573Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.965573Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:63ced1c44588f0d04619db20e2b5ab9fad330c924fa45e19e58b87cd1b61a847","observation_id":"551f9183-6011-4774-a690-29566546a9c1","resolution":{"observed_at":"2026-08-07T11:57:28.965573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:57:28.969116Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.969116Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:ea81fba78002c312ddc4f219fbc398f720b106a915e8ec95d5b7d8e2cd4ff48f","observation_id":"b2f78582-7e3d-46ff-ad52-36f938fb7e84","resolution":{"observed_at":"2026-08-07T11:57:28.969116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17604","last_updated":"2025-08-19T19:14:56Z","snapshot_observed_at":"2026-07-06T18:20:52.408832Z","submitted_at":"2024-05-27T19:07:13Z","title":"LoRA-XS: Low-Rank Adaptation with Extremely Small Number of Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17604","snapshot_observed_at":"2026-08-07T11:57:28.972955Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.972955Z"},"links":{"cited_paper":"/paper/2405.17604","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0c0cc01294c33c97a797bed18514f5bad5f4483ca5c5a22183871abe7a90ab7b","observation_id":"0746c1e7-aa97-4e50-b269-2fbc6807cd5e","resolution":{"observed_at":"2026-08-07T11:57:28.972955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.976631Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.976631Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:31a9cf280812657587f8bb2a7038b473f88d1a368c58e3c529a3dabad5959fce","observation_id":"f31865e9-46bc-4f4e-83af-6ca0a2eb761f","resolution":{"observed_at":"2026-08-07T11:57:28.976631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.980071Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.980071Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c212005e0cd5892e880eb108364fed324e136fc59630822b1d4a95eeeebc1509","observation_id":"ff8d07a4-c54e-4f38-97eb-367bb43c0c7f","resolution":{"observed_at":"2026-08-07T11:57:28.980071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.983339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.983339Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:92060f4968e26fa2ac476860d66107280acbbe2df3c9137705c77cedd88ddd28","observation_id":"52fac5ca-1489-47af-8830-ce9d1cc63cc6","resolution":{"observed_at":"2026-08-07T11:57:28.983339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16236","last_updated":"2025-07-03T06:59:56Z","snapshot_observed_at":"2026-08-04T14:59:50.724834Z","submitted_at":"2024-10-21T17:41:28Z","title":"LLaVA-KD: A Framework of Distilling Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16236","snapshot_observed_at":"2026-08-07T11:57:28.986563Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.986563Z"},"links":{"cited_paper":"/paper/2410.16236","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d2bdcd0a69ea72b505b47bd50ae84b6b241ef8d59c67dd66c615dc16a47f1158","observation_id":"acd9c9c6-d16c-4306-a6d0-9b5881e8ea8c","resolution":{"observed_at":"2026-08-07T11:57:28.986563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.991360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.991360Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:a3e3b94928ca9d7667a320fc73e8bbddc1841d58fd771a005682b8c517da18ff","observation_id":"f2b3a661-29ae-442f-9be4-8049a765a487","resolution":{"observed_at":"2026-08-07T11:57:28.991360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.995330Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.995330Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:11d3b5429e8b17f61c134703a77eaa7b13afecdedca3474a6a1b789e3a25cab4","observation_id":"ad7b1bb8-15bc-46ae-9929-e2f44bc0ca30","resolution":{"observed_at":"2026-08-07T11:57:28.995330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.998658Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.998658Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:83e71563a4d3744bfe8cf09c7893d37f4b79667553fbb008059a23a2278b2256","observation_id":"3cd80351-bc8c-47b5-abf1-f6c9500b5ca5","resolution":{"observed_at":"2026-08-07T11:57:28.998658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.002055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.002055Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e9cc7119e4629cbeb1582dd1a681ae0e03a504a79e33886c074a69aa2c08a4b4","observation_id":"e68aeed3-1427-4dc0-bee3-9e33ee9beed7","resolution":{"observed_at":"2026-08-07T11:57:29.002055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T11:57:29.005938Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.005938Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:5d1801fa7a78fe06d930fae5210d02b2babc4d9c87be3d7f57a5bc0cabe4618c","observation_id":"692be308-d7b0-470f-9cb0-d27506ec7c40","resolution":{"observed_at":"2026-08-07T11:57:29.005938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:57:29.010001Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.010001Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f84bdcaa5820f2a2124b8502cc326c3bf4c95a3ad160f7e8f621250ec444f9bd","observation_id":"e73f06e3-5284-43c7-a3a7-e651d2fa2cef","resolution":{"observed_at":"2026-08-07T11:57:29.010001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T11:57:29.013438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.013438Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:bbda13464e6407bedb8bf60f33ae0921db76fd9fdbfc64b49e5a9dd7fb1959c4","observation_id":"4038c6b4-e5b0-41c2-acfa-ba023fc04a99","resolution":{"observed_at":"2026-08-07T11:57:29.013438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.016941Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.016941Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e98045c2644e00291c2dc93fd5b7f41015463ba1e9ee9f57e3cf323d19d22da4","observation_id":"9bc5028c-58e4-4e6e-b142-8b2c4c3e1e08","resolution":{"observed_at":"2026-08-07T11:57:29.016941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.020514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.020514Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c6c578bbb4cd4ccacd71badaf09eda298cc78d33dfdb4f562efa1ef093bcf053","observation_id":"3d09eed9-f3f1-4f1b-b336-868922556f8a","resolution":{"observed_at":"2026-08-07T11:57:29.020514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.024107Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.024107Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0caf90c191ca3a29ce9defe07e149dfc42ec440e521f85a9a83a8ae8544648de","observation_id":"2b3ff932-08e5-4c17-91a2-f03696222cde","resolution":{"observed_at":"2026-08-07T11:57:29.024107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.027322Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.027322Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:5ea044ffc56d1499ff7d5fa5d8ed256813ae66ee885f82036bd0259cf44adf45","observation_id":"82a835d2-ab35-4e35-8390-b26a6bc7eb62","resolution":{"observed_at":"2026-08-07T11:57:29.027322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.361040Z","title":null,"venue":null,"work_id":"9a4411ca-5a77-4ba0-9362-f3ccff1da173","year":2017},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.030485Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:790d08870c7f38709f0e184f6da2e6580ab09786e68fa33fd0869d1e95601348","observation_id":"971fbb92-8263-4497-9930-f1671856488c","resolution":{"observed_at":"2026-08-07T11:57:30.364643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.348997Z","title":null,"venue":null,"work_id":"1d980276-2501-430b-a35d-806c288a1e22","year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.033741Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f021b69a2e06b0cea309b73c43074bb5d6c7cb938ff4a2897f58f47715cf465a","observation_id":"c48c3115-6596-43e0-b15e-8798df9e7736","resolution":{"observed_at":"2026-08-07T11:57:30.352712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12354","last_updated":"2024-07-04T18:33:00Z","snapshot_observed_at":"2026-08-03T17:12:16.534784Z","submitted_at":"2024-02-19T18:33:49Z","title":"LoRA+: Efficient Low Rank Adaptation of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12354","snapshot_observed_at":"2026-08-07T11:57:29.037629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.037629Z"},"links":{"cited_paper":"/paper/2402.12354","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3d65641dfc66f941fafc13cdbbb4f8fb10a7cd997f656e6db3113e7d789734d3","observation_id":"fd64ccbf-f79b-4857-82be-e64792012b92","resolution":{"observed_at":"2026-08-07T11:57:29.037629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.335742Z","title":null,"venue":null,"work_id":"e5acaebe-c0d5-4068-9328-f608a759e14c","year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.040979Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:59201bd4bd4215c871dd2978fb8d42979f259ef387dd00fbc9b9a797b1da9125","observation_id":"7292eecc-2457-4f45-a096-18a097d6434f","resolution":{"observed_at":"2026-08-07T11:57:30.339368Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.324553Z","title":null,"venue":null,"work_id":"0cea88ae-3d42-45a5-8761-a0692779e3a7","year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.044311Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:825ff411b2d90e57cbedc714cd265782eb195332bd1b3bd1c8533d348a347dff","observation_id":"165ad793-8fe0-459a-8b08-99fa783084ed","resolution":{"observed_at":"2026-08-07T11:57:30.328100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:57:29.047501Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.047501Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:127232656f8346b2d7b0d54bd5574b4715ba39686edde3038d167e5f8818ee32","observation_id":"d79f9994-2fba-40fe-89ff-79a511e26d96","resolution":{"observed_at":"2026-08-07T11:57:29.047501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01933","last_updated":"2023-10-09T15:38:46Z","snapshot_observed_at":"2026-07-06T15:12:11.121128Z","submitted_at":"2023-04-04T16:31:37Z","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01933","snapshot_observed_at":"2026-08-07T11:57:29.051249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.051249Z"},"links":{"cited_paper":"/paper/2304.01933","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:39e33f4e1e6bdcca9bb6d9aad049085e73a2371df273919b86413d301c56cc5e","observation_id":"05cda9ed-9b95-4933-ad63-6ddbaff80b92","resolution":{"observed_at":"2026-08-07T11:57:29.051249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06842","last_updated":"2025-02-28T15:15:31Z","snapshot_observed_at":"2026-08-03T19:24:54.593615Z","submitted_at":"2025-01-12T15:21:22Z","title":"SPAM: Spike-Aware Adam with Momentum Reset for Stable LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06842","snapshot_observed_at":"2026-08-07T11:57:29.054680Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.054680Z"},"links":{"cited_paper":"/paper/2501.06842","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:b7b81298647b18008c6a127ce16db9cc9ddf6651c490ca15e95d91ebaa0db459","observation_id":"9dd4f4fe-d38b-496a-ae49-bc58b853c8da","resolution":{"observed_at":"2026-08-07T11:57:29.054680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.058208Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.058208Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e701e5efe1340f1253cc109dcba18d920f58ddaffaf1ece86517c36dd5f4f1d3","observation_id":"331539f7-7b6a-463e-93b9-846c81e04baf","resolution":{"observed_at":"2026-08-07T11:57:29.058208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-07T03:29:16.217842Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-07T11:57:29.061428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.061428Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f7dbfc9ecbd63ac59fd8092c60e5eaa12a6ca92f8ea1743188d6a6ec55b207fd","observation_id":"cbab1350-ed83-40e4-9c6d-b1b7bb62ffb6","resolution":{"observed_at":"2026-08-07T11:57:29.061428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.304269Z","title":null,"venue":null,"work_id":"0ef1bb75-7836-4631-9567-d55b108ec83a","year":1994},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.064748Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:42e468b9d950d1f8a93adcc207717cd23bc3f195c04c517859886e68b7861fe0","observation_id":"0f00894e-3412-4e42-903f-4742cd1e9907","resolution":{"observed_at":"2026-08-07T11:57:30.307740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.293031Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"69a15207-86a8-4971-9579-ca8293de9319","year":2015},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.067938Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:ec5aae78e9f218a165e9d9af31f83dac2e0ba66de38b2235a4c84e6c300750f0","observation_id":"c83b9a68-badd-459f-8bb2-6f2024d8bbd8","resolution":{"observed_at":"2026-08-07T11:57:30.296503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.281750Z","title":"o pf, Yannic Kilcher, Dimitri Von R \\","venue":null,"work_id":"37024741-5d44-41be-a612-100b507c46b0","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.071052Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:508ea909b6dacad47cf79c3ade4c5a177f1fe93a38640196d473d6fe0b15cd2a","observation_id":"ae32cc3f-32fa-495d-8410-ca4a74769a87","resolution":{"observed_at":"2026-08-07T11:57:30.285335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T11:57:29.074356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.074356Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:bb2419a78a33cf95135b71dc9d6624489d5381868ce178e831b901386565552d","observation_id":"05593c1e-0953-4188-becd-72abe6222c2d","resolution":{"observed_at":"2026-08-07T11:57:29.074356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09695","last_updated":"2024-04-15T11:53:22Z","snapshot_observed_at":"2026-07-06T18:00:16.713949Z","submitted_at":"2024-04-15T11:53:22Z","title":"LoRAP: Transformer Sub-Layers Deserve Differentiated Structured Compression for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09695","snapshot_observed_at":"2026-08-07T11:57:29.078239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.078239Z"},"links":{"cited_paper":"/paper/2404.09695","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:31a5318ccccd14450db71718ddf7172275ede81bb45809e68e1d3fb57b623bca","observation_id":"109676e1-f73c-4df9-a5d3-778c96f7cd5f","resolution":{"observed_at":"2026-08-07T11:57:29.078239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.081480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.081480Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3bd26b2a88d1a33ead0793f5a805073ec47c0fc231bbc5caf1c80ab1dd321c85","observation_id":"10c826ac-215f-4559-8d2c-002b3bdd6f5a","resolution":{"observed_at":"2026-08-07T11:57:29.081480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14578","last_updated":"2024-10-28T04:10:40Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T13:52:36Z","title":"Surge Phenomenon in Optimal Learning Rate and Batch Size Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14578","snapshot_observed_at":"2026-08-07T11:57:29.084798Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.084798Z"},"links":{"cited_paper":"/paper/2405.14578","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:30fae30dff0717eedc5fa9e0771b01c189741868c25755f029a9ed5737e81211","observation_id":"84c01ecb-d986-44d9-846c-1c85806a28e3","resolution":{"observed_at":"2026-08-07T11:57:29.084798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06373","last_updated":"2024-10-08T21:14:23Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T21:14:23Z","title":"Unveiling the Backbone-Optimizer Coupling Bias in Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06373","snapshot_observed_at":"2026-08-07T11:57:29.088289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.088289Z"},"links":{"cited_paper":"/paper/2410.06373","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:926615f409446a0615a45ed74ef77ecac322f8d6c39e2d3e42a0450c50443ec0","observation_id":"88980bb8-475c-4efc-8aa0-b0dffb53b9f5","resolution":{"observed_at":"2026-08-07T11:57:29.088289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.261167Z","title":null,"venue":null,"work_id":"0a12b680-217f-4d0b-93f2-2b3db344e0a5","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.091805Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c27949292ded1a77417edb93d02b14019d68a37a1eb14d1db57f43b75e2a6f32","observation_id":"364bbec4-e582-4037-b2b8-ce6cc5bc78cc","resolution":{"observed_at":"2026-08-07T11:57:30.264637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.248816Z","title":null,"venue":null,"work_id":"a1110009-ce1f-4986-842d-49769361bbf7","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.095039Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:15b7cfce98ab7b85c6e278a6f8a0f42e42dba514094cbac6c52668580f261a83","observation_id":"7cdfcf04-d675-4a18-854c-468ef8462bf5","resolution":{"observed_at":"2026-08-07T11:57:30.252122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.236240Z","title":null,"venue":null,"work_id":"887047c0-37ed-4b3a-bf5b-f8d7ea08795b","year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.098283Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:76e590bebfef62118c6ec231902feff6c60cb0518bb25564b56f718c9de652aa","observation_id":"dc732852-44aa-4a48-9b37-8a32aae9c42d","resolution":{"observed_at":"2026-08-07T11:57:30.239884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.224197Z","title":null,"venue":null,"work_id":"e5683aa4-5387-4f23-a26c-e77661a105a7","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.101419Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:2f5955f5aea434d153b069a9bb9d3b548b96d78d4ddaac6173a24741b202f8b1","observation_id":"f23a6cc7-1999-48cb-a9f3-eea0fd23118a","resolution":{"observed_at":"2026-08-07T11:57:30.228139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.212958Z","title":null,"venue":null,"work_id":"a668f051-fea4-4b05-b191-c839dcfc49cb","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.104867Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:03d8c4db2f6b73fdfb112ff1564723d5966b047b7704503662ddec9abea67c3c","observation_id":"58996f95-d9c1-4333-a044-f7b8b12fb5d0","resolution":{"observed_at":"2026-08-07T11:57:30.216422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-07T11:57:29.108339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.108339Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:b0282eacb569f6e589ee41e1dc5c64bb8b8822424a8843aa30e371724409d273","observation_id":"d965385b-4881-4497-a283-25194e44450c","resolution":{"observed_at":"2026-08-07T11:57:29.108339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.111921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.111921Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:14d6007b652c29d2f56f59bda00f5bc333323a650b2c245eaae15558c75e2e9f","observation_id":"f77f1f80-dc91-4ecc-b75a-d070ee67d29a","resolution":{"observed_at":"2026-08-07T11:57:29.111921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.115370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.115370Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:76576bd24e842aaba41f428d21f93eb4990ff7f5e2a92717690513f66f36dcf8","observation_id":"f249484d-dc3b-4482-b5f3-a6ae44cf3c29","resolution":{"observed_at":"2026-08-07T11:57:29.115370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-07T11:57:29.118553Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.118553Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:4b3a6092a06fab1266120ccf63c22976025f2e4b8566cda03dd17e25e5268801","observation_id":"01d72d3a-a244-4dcc-9acc-ac26c3dc937d","resolution":{"observed_at":"2026-08-07T11:57:29.118553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.184958Z","title":null,"venue":null,"work_id":"933ab08d-b7ed-472a-9090-f640f337af27","year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.122075Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d3d0a6de95ddd4bf40fbc0b8ba9eb760b76cac1ab6402b94ea3044093e88ec22","observation_id":"c88cdf3a-b3a5-47fd-9c7a-756791a6b415","resolution":{"observed_at":"2026-08-07T11:57:30.188577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.173245Z","title":null,"venue":null,"work_id":"7ccedee9-f729-4134-acc0-8f8797e094a1","year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.125346Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:6ce75fba9ef3cc164501f2dd9b06deac6b2c8e51c9b814670c90cf52929f3ae6","observation_id":"bd877286-b983-49ef-a3a1-6eeba05ac596","resolution":{"observed_at":"2026-08-07T11:57:30.176770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-07T11:57:29.129514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.129514Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c099dca5970a1b4e2ef9bc554c0e1033a726bbe230e49a2a86222b84a7a36a38","observation_id":"60d1ffe9-8272-4615-84eb-d64e913ea568","resolution":{"observed_at":"2026-08-07T11:57:29.129514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.161488Z","title":null,"venue":null,"work_id":"39db9135-16ef-4e05-a5fd-75498f9f6937","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.132995Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:7020b6e335b193a8d4c0115997db9ef6476423d5188a02e511b4db1adc830d4b","observation_id":"cc653f9c-4569-4eb6-86cf-d8074085a207","resolution":{"observed_at":"2026-08-07T11:57:30.164748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.149788Z","title":null,"venue":null,"work_id":"a42f5aaf-01f8-4901-9a47-533753ab4d4f","year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.136203Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f9fb2ebd277b9d276722897ecc0bc93250701c69d3436eb77e545556312af8f2","observation_id":"e9786330-16e2-47b7-8b01-43fb2e0337be","resolution":{"observed_at":"2026-08-07T11:57:30.153328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.138102Z","title":null,"venue":null,"work_id":"504e8d85-b2c4-4856-a5d7-fffc169eb190","year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.139446Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0bd145f14754b509911dadfda4bf53db7f7d92660e2211b1817259a3a505a5de","observation_id":"476339c5-5912-4f3c-bb0e-e5fb722a7511","resolution":{"observed_at":"2026-08-07T11:57:30.141876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.125920Z","title":null,"venue":null,"work_id":"0382c636-3fde-4767-a0a5-5071c9e15d60","year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.142621Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c508a964b941f2dfe219c4b4d930e7731a3eb5824f1cef9e7b81c4787219a54f","observation_id":"b931a06c-dd32-4450-988e-2683564428c6","resolution":{"observed_at":"2026-08-07T11:57:30.129665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.114680Z","title":null,"venue":null,"work_id":"a1bbbe76-f3e8-49bd-b7a4-9d64acda2671","year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.145820Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:41a351697ed74007562fb71af235b91365c8ccd20e89af3bf6a312b73e719d8f","observation_id":"16288887-825e-4553-aa28-8fd0e6c42175","resolution":{"observed_at":"2026-08-07T11:57:30.118083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.103606Z","title":null,"venue":null,"work_id":"10e9172e-cfb9-4b17-8a1d-3a81f5b8c3cc","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.149567Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:beb69e4d90ce7d2d787456d0904e4cb87ee081de6aa9e2216930a4078f57d029","observation_id":"d1cd5d36-7d70-46d1-9dfc-ce586ea37d32","resolution":{"observed_at":"2026-08-07T11:57:30.107042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02047","last_updated":"2023-08-07T06:21:31Z","snapshot_observed_at":"2026-07-06T15:50:26.113234Z","submitted_at":"2023-07-05T06:05:36Z","title":"CAME: Confidence-guided Adaptive Memory Efficient Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02047","snapshot_observed_at":"2026-08-07T11:57:29.152833Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.152833Z"},"links":{"cited_paper":"/paper/2307.02047","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:65730284e95ff14620ec94dab9b24761ebca2ce87478ba3ea60370ebe6d4562e","observation_id":"dfa9f3e3-acae-45c6-8047-415b0567a2ef","resolution":{"observed_at":"2026-08-07T11:57:29.152833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20339","last_updated":"2024-05-30T17:59:47Z","snapshot_observed_at":"2026-07-06T18:22:57.400982Z","submitted_at":"2024-05-30T17:59:47Z","title":"Visual Perception by Large Language Model's Weights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20339","snapshot_observed_at":"2026-08-07T11:57:29.156262Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.156262Z"},"links":{"cited_paper":"/paper/2405.20339","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:a705641488c0d9bc1a642af7099b6339fb2a54281bc88ed5f4a36d121b242bd6","observation_id":"28962728-0aa8-47cb-bd0e-ce6920dfe53a","resolution":{"observed_at":"2026-08-07T11:57:29.156262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.091680Z","title":null,"venue":null,"work_id":"51236cf4-5e27-49de-b072-5475c7927770","year":1967},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.159763Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c6173a90f98deca8b818942a9e1c51523f37c54b46fdb5f453da22ecd30491d2","observation_id":"897b4096-df09-470e-8495-9f998b50dd0e","resolution":{"observed_at":"2026-08-07T11:57:30.095539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T11:57:29.163047Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.163047Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3d0ffdbe0968d4fffe68085659a6a8175cdbbcf9854e237d8c5cb8e8625426e1","observation_id":"3a9a2b64-3069-4a7c-ae52-e76ccfec22df","resolution":{"observed_at":"2026-08-07T11:57:29.163047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-07T11:57:29.166603Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.166603Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:73fc98c117b421ee969c39047a1ad7c4d7be0fc4430181ee16627eb48213ad36","observation_id":"432c66dc-b5e1-4d55-91c0-e6a82faaa734","resolution":{"observed_at":"2026-08-07T11:57:29.166603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12067","last_updated":"2025-01-21T11:42:09Z","snapshot_observed_at":"2026-08-02T07:43:20.201763Z","submitted_at":"2025-01-21T11:42:09Z","title":"EDoRA: Efficient Weight-Decomposed Low-Rank Adaptation via Singular Value Decomposition","version":1},"cited_work":{"arxiv_id":"2501.12067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12067","snapshot_observed_at":"2026-08-07T11:57:29.511703Z","title":"EDoRA: Efficient Weight-Decomposed Low-Rank Adaptation via Singular Value Decomposition","venue":"cs.LG","work_id":"82bda866-70e4-45ec-88fd-9857c5bdab85","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.170521Z"},"links":{"cited_paper":"/paper/2501.12067","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:54b76d716078eb6b99f17409817b213df4ad169aa4c539e7b3c783e1a131b528","observation_id":"21b291a7-59a5-4f8b-8bc7-13a0211d6ec5","resolution":{"observed_at":"2026-08-07T11:57:29.517503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.079040Z","title":null,"venue":null,"work_id":"42ef8228-6257-4e60-b0ad-437c5261d890","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.174065Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:5f1ec08a55f15773efed0b5675982fa5acab3a3410a8c316209508ec96ac0b93","observation_id":"7c681ca2-5a6a-42e7-b647-7079d06871f0","resolution":{"observed_at":"2026-08-07T11:57:30.082626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.177371Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.177371Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:ab60aa5ad62bba14f580968c37ea6cc6da9a359a7b59607956400bf3ca502c3c","observation_id":"b89d3d72-25b6-4554-8823-3b457dc481da","resolution":{"observed_at":"2026-08-07T11:57:29.177371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.058513Z","title":"Reddi, Satyen Kale, and Surinder Kumar","venue":null,"work_id":"5a6abf41-035d-4cb5-b63f-194b36b10a8b","year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.180610Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0a7147accfe98a9452b6d9ea10419d3643c80f2427e71ea7a227434f2494ed13","observation_id":"63d0ecf8-4439-4f80-b8f9-a4d88e9b00a6","resolution":{"observed_at":"2026-08-07T11:57:30.062417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.183773Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.183773Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:4abf711c94c6f0c1be43cf028b5d70d2713fd3b608a02eec54937ae966ae818f","observation_id":"89ed90fc-8074-4108-bc77-7327446f2e31","resolution":{"observed_at":"2026-08-07T11:57:29.183773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-07T11:57:29.187200Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.187200Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:810d1899b87519cdd52a2e0dfdccc82f7e4dfa19550ee93e8ee7eaf8df11e4ac","observation_id":"10022d71-56be-4848-a29a-443a275c82c6","resolution":{"observed_at":"2026-08-07T11:57:29.187200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.038512Z","title":null,"venue":null,"work_id":"528574e8-95e5-4459-8603-44c17dc33fd6","year":2010},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.190488Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e9cfc525862a6b63f5cd654eb0e37d41c639ac2af9d398dc21d032c937dc826e","observation_id":"35116b00-3bc9-47c6-9fa4-a821ae2ae174","resolution":{"observed_at":"2026-08-07T11:57:30.041991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04235","last_updated":"2018-04-11T21:42:32Z","snapshot_observed_at":"2026-07-06T06:32:58.709094Z","submitted_at":"2018-04-11T21:42:32Z","title":"Adafactor: Adaptive Learning Rates with Sublinear Memory Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04235","snapshot_observed_at":"2026-08-07T11:57:29.193839Z","title":"Shazeer and Mitchell Stern","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.193839Z"},"links":{"cited_paper":"/paper/1804.04235","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:6a818447d4f025ccef257103627d9cc2c9e3c963262418fd7a0f21d40c5cc1e3","observation_id":"2e966505-a288-4ba3-b062-3fa242178992","resolution":{"observed_at":"2026-08-07T11:57:29.193839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15881","last_updated":"2024-10-23T09:52:23Z","snapshot_observed_at":"2026-08-05T18:22:08.247118Z","submitted_at":"2024-08-28T15:52:23Z","title":"LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15881","snapshot_observed_at":"2026-08-07T11:57:29.197574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.197574Z"},"links":{"cited_paper":"/paper/2408.15881","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:90d3539ef0dac5cf9ae4124495f41e11d97d8df075431ca2e8b05004184f32e4","observation_id":"e5acd949-8072-4ba1-91a2-67b0f7a43217","resolution":{"observed_at":"2026-08-07T11:57:29.197574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.200848Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.200848Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:30c63e8a2c775c12cc620b1f0cbd45731818d3f81ea7a7c9d6eb47eb24cb98bc","observation_id":"e7cbdbc6-d00e-48ee-bb36-3159467da3d8","resolution":{"observed_at":"2026-08-07T11:57:29.200848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.018349Z","title":"Sinha and Michael P","venue":null,"work_id":"534ad3f2-fe43-442c-b9c0-81d2425eee57","year":1971},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.204136Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c2ba81782afb2df1ee865c965e4cdbe4357216e0648cf66527f5e026407a9f9d","observation_id":"35eca4f5-bb6e-41e3-a6af-5695ac55c152","resolution":{"observed_at":"2026-08-07T11:57:30.021951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.207378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.207378Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:bca58f8306ea42c9ade51007567590302ead6693b91e2b374e246d720204de44","observation_id":"05858b3f-1b4d-414c-91b4-fcfbaf86820a","resolution":{"observed_at":"2026-08-07T11:57:29.207378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.210678Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.210678Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:9fe6dad0ff49934a38fbd1f527d33e3606549f579e526b5a2acf575af1125775","observation_id":"c41112a3-43f6-4036-b58a-eefa42ff0149","resolution":{"observed_at":"2026-08-07T11:57:29.210678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-07T11:57:29.214022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.214022Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:384c42cd11c0b81c811fe04a4a2356b73b8244ce9430ef411d526b7f351c7adf","observation_id":"93957090-2b1a-4fb8-b488-492be99e021e","resolution":{"observed_at":"2026-08-07T11:57:29.214022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-07T11:57:29.217387Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.217387Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0f6acb397998a24c9ea1eb41626d44ce1cf3c9567386ef6cd9ba260887dca83e","observation_id":"67f2c45a-9ca7-4b76-84dc-c6dcdb8ce9d1","resolution":{"observed_at":"2026-08-07T11:57:29.217387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.989679Z","title":null,"venue":null,"work_id":"42cb85a6-b7f0-4f41-8a80-cd24542cf9e4","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.220927Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e0423e931a11cfbfdc0523219df7521aa75e5b7dcfb0c3eb2da50b16fd408152","observation_id":"a56bb22a-4cd7-401b-a945-b401ac0a3a33","resolution":{"observed_at":"2026-08-07T11:57:29.992788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T11:57:29.224160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.224160Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:cf3148b07896f8e1d83af0cbc78157e49c2deb76f1fef324e299dca16afdce68","observation_id":"58806685-fab1-4a62-8eef-0b1953f973ce","resolution":{"observed_at":"2026-08-07T11:57:29.224160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.976742Z","title":null,"venue":null,"work_id":"45d4487c-042f-4272-bffd-358529fa3077","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.227542Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:67ba867832c2fbbeb68deb19d9658c83da683fcbbf8cb907e37db520adbaa0a5","observation_id":"27195656-a9b3-4348-bf49-d5c7179c9221","resolution":{"observed_at":"2026-08-07T11:57:29.980801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-07T11:57:29.230732Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.230732Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e3fd33ccb977d0693e5d1e3f2512132da3af591768f782886bda28ea1c0d8899","observation_id":"40064f04-3bae-490b-bee2-4066438baa9a","resolution":{"observed_at":"2026-08-07T11:57:29.230732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.963567Z","title":null,"venue":null,"work_id":"07904a5f-7e4d-40a9-b633-7ee70331aed1","year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.233998Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:bc9099100428545d5033a339c6463d61cb3e4f7aef90a9b47e5ef8ea4409181f","observation_id":"e0699f0b-c24d-4f2e-b5d5-575773268cff","resolution":{"observed_at":"2026-08-07T11:57:29.967560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.951759Z","title":null,"venue":null,"work_id":"b2b0a097-cda2-4435-8cd4-3253eb0f3107","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.237565Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0cebf310a9a8c77e880df8e9a094f55e47f8eb36837e11ef25389628e1b757d7","observation_id":"488b4aeb-24ea-4312-9f2b-73aa3153362d","resolution":{"observed_at":"2026-08-07T11:57:29.955405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.939857Z","title":null,"venue":null,"work_id":"ec77c145-e443-43d7-af3a-9e0cbe988629","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.241519Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3c80c7434914cdc81a88f805f108390fe51842a5b413991d9ac5a70738e820b5","observation_id":"29cfd7c2-10a0-46a8-859c-59632a011363","resolution":{"observed_at":"2026-08-07T11:57:29.943249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T11:57:29.245272Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.245272Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:1f263eb2e2674004180fb28d6965b2ab659e8af856be506c289c79826bcc89c8","observation_id":"ca378888-4d58-4a7c-b368-cd91497d0e09","resolution":{"observed_at":"2026-08-07T11:57:29.245272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13787","last_updated":"2025-01-23T16:04:23Z","snapshot_observed_at":"2026-08-07T07:30:22.453328Z","submitted_at":"2025-01-23T16:04:23Z","title":"Parameter-Efficient Fine-Tuning for Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13787","snapshot_observed_at":"2026-08-07T11:57:29.248704Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.248704Z"},"links":{"cited_paper":"/paper/2501.13787","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f8acd335be62037a54979f6fb42e5093a6a726b2d6b59e6b2b79d700360b2d60","observation_id":"9a396661-7194-4d09-9c32-792aaac1e40c","resolution":{"observed_at":"2026-08-07T11:57:29.248704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.928646Z","title":null,"venue":null,"work_id":"a811b79c-7882-4506-97c7-a03054c6cb18","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.252216Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:91edee7825d4deb4132d462caaa2124e003e72aadab04c5f9e0589940e6965ca","observation_id":"210d5578-f9c6-4cd4-8a05-e7b376f11d57","resolution":{"observed_at":"2026-08-07T11:57:29.932025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-07T11:57:29.255600Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.255600Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:2cf4183f999da79091caf289e2d8adfffaccfa731d65fcef8703eb2e29b19756","observation_id":"08551d6d-0321-4715-9421-bc9c26773f70","resolution":{"observed_at":"2026-08-07T11:57:29.255600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T11:57:29.259287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.259287Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e9bd54e1b923ac5f73c40551b7dc045eab60bba3ae49b46278816bd41e0e49ba","observation_id":"5d65b0bc-6e39-43ed-8c87-c595703282c0","resolution":{"observed_at":"2026-08-07T11:57:29.259287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T11:57:29.263146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.263146Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0076f12916135117681c440590bde9bd6e440ffa61af725795ab77e59814fa9c","observation_id":"b19eaa3e-d997-4475-af1e-df2e6a124e0c","resolution":{"observed_at":"2026-08-07T11:57:29.263146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-03T05:27:32.394774Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-07T11:57:29.266772Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.266772Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:9a04c47cc5df479ecc41c57ea4e1536fa951aae3352312947d7908a5e09de2f9","observation_id":"fcc700fc-9253-4936-a883-bf2c1addffe4","resolution":{"observed_at":"2026-08-07T11:57:29.266772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-07T11:57:29.271257Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.271257Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:a957f77dd4dd71d389284cc85608fae2278cc0a11247612874883289dd2aa330","observation_id":"4ec620a7-60ca-46d6-8a67-437c76a0961b","resolution":{"observed_at":"2026-08-07T11:57:29.271257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10622","last_updated":"2025-06-14T08:10:48Z","snapshot_observed_at":"2026-08-07T22:20:27.338782Z","submitted_at":"2025-03-13T17:59:06Z","title":"Transformers without Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10622","snapshot_observed_at":"2026-08-07T11:57:29.274935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.274935Z"},"links":{"cited_paper":"/paper/2503.10622","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3a2f8e5ca3f793eccdf6ab58cf2275cb4ac50408eb5cc903fda6046f224f0b03","observation_id":"b4fcc1d0-1de3-4fe9-9690-5d3932797f3c","resolution":{"observed_at":"2026-08-07T11:57:29.274935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.917267Z","title":null,"venue":null,"work_id":"737ac0e7-daf1-4f1c-9d38-47ef1f7fdf26","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.278658Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:722ed9596932096e11f2209e4948db1e642811606c2d1a65b2291c34f04cd7aa","observation_id":"52272ecf-36fd-481c-87d1-ff47692244fe","resolution":{"observed_at":"2026-08-07T11:57:29.920689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:23:46.839915Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 2 inbound Pith citation observations for arXiv:2506.01049."}