{"as_of":"2026-08-09T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb4805391c26f26f5a2ed308ba19998e12b7be56f279d3a0e9a6fb8de598dad5","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T16:03:20.699893Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07884/citation-record","integrity":"/paper/2607.07884/integrity","json":"/paper/2607.07884/citation-record.json","paper":"/paper/2607.07884"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/0893-6080(89)90014-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural networks and principal component analysis: Learning from examples without local minima.Neural Networks, 2(1):53–58","venue":"Neural Networks","work_id":"c3d48c07-17fe-409c-9b44-cfb9d94cfee1","year":1989},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:bd54835a089e9165fc5f271c035c02ce84861deccd1180b24ae2a7a027deaebf","observation_id":"8a687248-9d56-477f-9000-e36bf26ed1e4","resolution":{"observed_at":"2026-07-10T16:07:20.252525Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.561380Z","title":"Gen , volume=","venue":null,"work_id":"44b5c4ce-c8f4-41b6-926b-150f302be29a","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:674dabe3743900018bab17a096d03b5cc2f0cb6c3fd9e4da3b0505dc05dc2fb2","observation_id":"cd8e9f22-3e4a-41a6-b4d8-2973b66b3033","resolution":{"observed_at":"2026-07-10T16:07:20.562939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.563802Z","title":"Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"7e32ea88-9983-4802-93c6-6136c9ad4763","year":2010},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:05c4cbcd3d95d6ff1abcca7a6faf42c43c81530167eeb99a03e965e0c81b461e","observation_id":"da70ab83-7e20-47ce-87a7-ba88138088a3","resolution":{"observed_at":"2026-07-10T16:07:20.565366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.646069Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"386c8744-2608-498c-b4c5-ccb1e6f02a5b","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:33fff343b5286918e9e2fd315489860e190c18f50d9521c94d4c17b65b9c8068","observation_id":"4cabddbe-cf2d-404f-8b71-030109a7906b","resolution":{"observed_at":"2026-07-10T16:07:20.648305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.631879Z","title":"Exponential expressivity in deep neural networks through transient chaos , url =","venue":null,"work_id":"1e5a931f-5cd7-4864-b531-43f646b5a6e0","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:a492c3c958858344e5799431c68305f782d701f42ac4b90ab532d0d95af8fa03","observation_id":"a55e118c-4e7c-489e-9e67-ca0ce54ca940","resolution":{"observed_at":"2026-07-10T16:07:20.633775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.573063Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"da67fc4b-572a-491d-b1d6-b97ce09f4eec","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:f01e0905ecc3154b545b1cc04e04d86574e2363bc2b2846ead3000539138dd5d","observation_id":"3023b154-5238-488e-9399-925e4cb6a0c7","resolution":{"observed_at":"2026-07-10T16:07:20.574459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.614105Z","title":"Zico Kolter , booktitle =","venue":null,"work_id":"14977275-e02d-4037-9083-388ead9ea60d","year":2017},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:218d6d3926f7c0d514676d253bcac91dfab8561d099f0304bba0c9969441b318","observation_id":"930da198-b5d1-4d9a-ba3d-1e1d45a8b20b","resolution":{"observed_at":"2026-07-10T16:07:20.615801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1088/1361-6420/aa9a90","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable architectures for deep neural networks","venue":"Inverse Problems","work_id":"4f0eab7a-e426-4871-b927-627ffbff3ff6","year":2017},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:8c5249c8541b180f1a2d1c485e62ef0d0fb9b16af38050a11e034fc0650b33ed","observation_id":"f1a9f19c-89ea-47ae-a274-c3d03a3be811","resolution":{"observed_at":"2026-07-10T16:07:20.254811Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-25T08:25:54.554828+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T08:25:54.554828+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.552409Z","title":null,"venue":null,"work_id":"f04ee972-7a96-47d8-8656-b4c48f31b828","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c7ca76f659bcdf65d35fc123bb10278c6ec9833f0216035d1108ce6e772954d3","observation_id":"d701b219-cb76-4ed4-b3e3-de792b432e17","resolution":{"observed_at":"2026-07-10T16:07:20.554030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.634540Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"60605810-8973-4cf8-adca-ca0b86a70b5e","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c25aab75e62430088c70912de88756814b2806fd33c365b649a16b997f930e4d","observation_id":"368a6c83-d58d-40e4-92e6-45324465ea90","resolution":{"observed_at":"2026-07-10T16:07:20.636631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.575171Z","title":"Dynamical Isometry and a Mean Field Theory of","venue":null,"work_id":"57f619af-a47f-4c96-b382-db61228316c3","year":2018},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:02abe113ba09122135dee2a2ece121c4d5388cdd132d3433fffe20d349717f27","observation_id":"215594c1-c043-4858-a838-839edcf6f5e8","resolution":{"observed_at":"2026-07-10T16:07:20.576754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.577579Z","title":"Zico and Koltun, Vladlen , booktitle =","venue":null,"work_id":"3a77dabb-fbf7-4993-809d-d99d48c82e72","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:dcabd242226fdf5ed6661eb90efcb52e22c0ac19b67fcc87bb830c39c9c6233a","observation_id":"687a7327-11a1-4804-8bfb-5b65337e3963","resolution":{"observed_at":"2026-07-10T16:07:20.578822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.637707Z","title":"Mathematics , VOLUME =","venue":null,"work_id":"1e28e033-af86-46bf-a3a3-6606e3b36447","year":2019},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:a119d91118d00391fe1ccc46745e2f28d65293ad5bff73c98499a973896638b4","observation_id":"caf47eda-729a-4b56-a7bb-5bf20b8402a5","resolution":{"observed_at":"2026-07-10T16:07:20.639508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.596057Z","title":"Saxe and James L","venue":null,"work_id":"52ed32f4-77a5-4ddd-9060-9f1b35b74649","year":2019},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:a2a3bce5a0aa795941e55cfce9c604303b5f9a384f429b785d79a2569526abeb","observation_id":"5364c6ae-9596-4256-a392-cbd56ab974b0","resolution":{"observed_at":"2026-07-10T16:07:20.597830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.621299Z","title":"Proceedings of the Thirty-Second Conference on Learning Theory , pages =","venue":null,"work_id":"c3b5c3a7-152e-4049-8d99-2484194a386b","year":2019},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:f6266377250104350d8ae9c5bf38fb2505a38ba7de05f4a6525f83aa38d03487","observation_id":"542b995e-ea7c-4f8a-9e8c-f410dc5b14bb","resolution":{"observed_at":"2026-07-10T16:07:20.623306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.594933Z","title":"Implicit Regularization of Discrete Gradient Dynamics in Linear Neural Networks , url =","venue":null,"work_id":"6612507d-7742-4e71-91e9-a8d42be62d02","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:7dbb3f81c8257c63e97b622edbd4a131e8837936a603bb6dcfbe1394fb915b0a","observation_id":"5d1c52f6-8eaf-4568-a70e-bcd096aa43cb","resolution":{"observed_at":"2026-07-10T16:07:20.596450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.633978Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"e65246c1-b293-458a-ac68-c07f7893034e","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:5bd870e93abb9c6024a60e2ed45b721d76e44ab98e762fd501a9b42b178af458","observation_id":"62db237f-7d76-4f55-9e29-45aa6fe2f193","resolution":{"observed_at":"2026-07-10T16:07:20.635414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.631204Z","title":"2020 , eprint=","venue":null,"work_id":"097441f1-67a5-4255-b088-89b8224d151c","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:5f4ae9c2d347dac43cc752d4cadca55e94bc93488ed9a0683a4f978a178ddefe","observation_id":"0f7e6eb4-8e16-4465-b038-60675834985f","resolution":{"observed_at":"2026-07-10T16:07:20.632623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.649261Z","title":"An empirical analysis of compute-optimal large language model training , url =","venue":null,"work_id":"09d026a9-9833-4cc6-8558-d51fe90a7e3d","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:842e273a8b4514ae6746207fb4d74762780c59171c658165d2f96e494c236a3b","observation_id":"2c768d4c-b83b-4417-a873-a3eb4d611d19","resolution":{"observed_at":"2026-07-10T16:07:20.651059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neunet.2020.08.022","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advani and Andrew M","venue":"Neural Networks","work_id":"8ff02d40-4bb8-444f-87e9-45087dd5d7d7","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3175b94f80d6b37a22b5eeba4c8bfbf086f9c06ceed7e5561320314397f7731f","observation_id":"0808331a-0776-4776-b6c9-4c6bb6f3d52e","resolution":{"observed_at":"2026-07-10T16:07:20.258992Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-06T20:38:20.29822+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-06T20:38:20.29822+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.623689Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":"0371f2c1-e8cc-4bd7-ba2b-1cd52e1b91e3","year":2021},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3c5e6145539e7d25b5f635f7a9f6f2ae5e75ab94a737e32469062b97da276b80","observation_id":"cdb7c0e7-f654-4cc6-9b6b-0e2940bf317a","resolution":{"observed_at":"2026-07-10T16:07:20.625378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.616135Z","title":"Exact learning dynamics of deep linear networks with prior knowledge , url =","venue":null,"work_id":"98f42055-29fc-4864-a6b2-cbf5262b5c1a","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3fa67c8f0eae59746a3ff781f0fba0d0c15de73ef0eb03714427cb74eaa22478","observation_id":"118a5d4a-ad92-4b95-bb86-2f29327de38e","resolution":{"observed_at":"2026-07-10T16:07:20.617816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.646312Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"0d19ef44-e6ab-4c32-a714-4b5a08e2b9a7","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:dba3a35c76e80082d9aa625ab819e2298fa3ff14f71fc0f162086be47c9fe385","observation_id":"c78c5037-e4ee-49f4-915d-11f55c8e7f59","resolution":{"observed_at":"2026-07-10T16:07:20.648494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.561847Z","title":"Proceedings of the 35th International Conference on Machine Learning , pages =","venue":null,"work_id":"53adbc40-77f6-471d-9ac1-bdc7520dad6c","year":2018},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:34dfefa6bc8b33686dcbb7cb6de131ccca6da19558c5291a04305bc57f511562","observation_id":"bbd5238b-a552-47a0-aa00-e406fd7b7fa7","resolution":{"observed_at":"2026-07-10T16:07:20.563279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.566528Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"01d57ee5-3a37-40b6-82c3-a09fa3aa4a49","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:0920e2274c4b7c19ad394e8c5238f5542ffa2697cec4b3ee4e8daf4048143e70","observation_id":"1770b131-9be9-4037-8c7f-184194bf71b3","resolution":{"observed_at":"2026-07-10T16:07:20.567880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.643635Z","title":"Algorithmic Regularization in Learning Deep Homogeneous Models: Layers are Automatically Balanced , url =","venue":null,"work_id":"398a0f41-1431-4717-bec9-4ebd4b8a0068","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:ff258ab85c4bca7ceb77da6dfd5cc3c67ca6791cb255c9d6084108f1b978a0f2","observation_id":"9f6c0a02-482d-4969-90d5-70a52e8dfbd8","resolution":{"observed_at":"2026-07-10T16:07:20.645434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.621308Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks , url =","venue":null,"work_id":"103f60ad-38fd-4542-94a3-ea4975706007","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:ff7611b51784504af4cf0649bdb2014f617efe74ab73aeb3dfe3d753cb816fce","observation_id":"630c31d4-2604-46c5-94c3-c55aaf8d83fc","resolution":{"observed_at":"2026-07-10T16:07:20.623055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.629091Z","title":"Learning dynamics of deep linear networks with multiple pathways , url =","venue":null,"work_id":"b31d6eb9-0c02-4ab3-8e15-b20d37896f62","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:a0edc748103b36848ba02cec7e507b06815efcdca71b738e07b39ff875892dff","observation_id":"51dc76ee-d3e1-4251-866c-e713a86707a3","resolution":{"observed_at":"2026-07-10T16:07:20.630994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.624038Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"ed008717-2b67-463d-9292-ec46d027f1b0","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:74085d0636638bd98e0d1f9b572855889ab62a7844ce9d62534629f65c14707b","observation_id":"f2cefb4a-00a7-4c9b-aeef-3e75caf8eaeb","resolution":{"observed_at":"2026-07-10T16:07:20.625746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.591732Z","title":"On Lazy Training in Differentiable Programming , url =","venue":null,"work_id":"e2df7ff0-7e2e-41af-8abb-b3d9ce18fd72","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:073e0d9797542574bdf354da3466cfa97fd3e57c84d0fc7376505de8856b1377","observation_id":"dab66938-3f60-44a3-980b-ea98c1c28db6","resolution":{"observed_at":"2026-07-10T16:07:20.593037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.570854Z","title":"Proceedings of Thirty Third Conference on Learning Theory , pages =","venue":null,"work_id":"5120c273-2023-49c4-b39d-e81bb86e5c66","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:8df4741d2f32a59806c1ae2897e33d0e9f2bccea58a08353da83943a105c77d4","observation_id":"1c3d7d0b-8a43-4c0e-8dff-0344efb8a3d6","resolution":{"observed_at":"2026-07-10T16:07:20.572433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.586737Z","title":"Proceedings of the 37th International Conference on Machine Learning , pages =","venue":null,"work_id":"2e9e7459-5b7b-4dbd-bd01-3c2604634d28","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:adad3d0ed3ca99e86743000125f547be633ba35bf7e424bebf742e928bcbcb91","observation_id":"4c3c4fcd-d375-4153-9275-14ce1849f4c7","resolution":{"observed_at":"2026-07-10T16:07:20.588362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15933","last_updated":"2022-01-31T12:58:39Z","snapshot_observed_at":"2026-08-08T08:13:53.762544Z","submitted_at":"2021-06-30T09:34:05Z","title":"Saddle-to-Saddle Dynamics in Deep Linear Networks: Small Initialization Training, Symmetry, and Sparsity","version":2},"cited_work":{"arxiv_id":"2106.15933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.15933","snapshot_observed_at":"2026-07-10T16:07:20.384070Z","title":"arXiv preprint arXiv:2106.15933 , year=","venue":"stat.ML","work_id":"755f4229-8616-4db7-ac4d-8b52abc3b055","year":2021},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"cited_paper":"/paper/2106.15933","citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:6fe482ef6bf059b69281e40d7634a0a4c04300a4d685856c46de5a6d56296a16","observation_id":"30a82447-6799-47ae-b1a5-dddadb43daf8","resolution":{"observed_at":"2026-07-10T16:07:20.385724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.643213Z","title":"The Shaped Transformer: Attention Models in the Infinite Depth-and-Width Limit , url =","venue":null,"work_id":"8de67503-7471-409f-9f47-a19f1572a72a","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:1ca68cd0100dcb567ba57783414c53cacf38d4a1e986c03cb4e16d61e8005dbd","observation_id":"4a64eb52-b03e-4b8a-9c94-e9858b371e5f","resolution":{"observed_at":"2026-07-10T16:07:20.645229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.625990Z","title":"Journal of Machine Learning Research , year =","venue":null,"work_id":"c1fe8f73-4023-4c17-8a49-abbb46bd11f4","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:0b6003e85e3cb4dd2b41dba76de2d273b06867942bccc6b50f6b59a5d2808ea2","observation_id":"c8af1a34-01bf-4dca-b7fd-1f047e3c2486","resolution":{"observed_at":"2026-07-10T16:07:20.627302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.599631Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":"b5211402-defc-4242-9560-225750afe796","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:94b8836d156dc2312e3073d9d3bb96745acf5926ac7558609d7ee9691471aedc","observation_id":"80506e23-a505-4263-b3f2-3156c69913d3","resolution":{"observed_at":"2026-07-10T16:07:20.601147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.598450Z","title":"Saddle-to-Saddle Dynamics in Diagonal Linear Networks , url =","venue":null,"work_id":"11b31670-95fe-4746-8fe8-283627c0f521","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:a840d3a69a05adfdb212b334360ac841c5279746ccb5dd2f2a360a811726e357","observation_id":"24837d75-761d-4b7a-aa8e-adf4ebe0b17a","resolution":{"observed_at":"2026-07-10T16:07:20.599906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.616550Z","title":"Proceedings of the 40th International Conference on Machine Learning , pages =","venue":null,"work_id":"236073aa-6d1e-4c3e-a927-51a46982dfb5","year":2023},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:535af51ef5b9da5071890cc1a369d4ab61928b86ab54064846f19c3abf33c5e3","observation_id":"b2b9b646-b713-4f02-85f9-f1491fb2255c","resolution":{"observed_at":"2026-07-10T16:07:20.618117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.649080Z","title":"Transactions on Machine Learning Research , issn=","venue":null,"work_id":"a2d5b891-a754-49a1-9095-a4d07c30ff85","year":2023},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:95b219f8a0149c861f8d7b536326478a49a24ba4d3ff8182fe33295261691aa3","observation_id":"cb90fa70-3ad6-45dc-905a-4937f474621d","resolution":{"observed_at":"2026-07-10T16:07:20.650648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.611920Z","title":"2023 , eprint=","venue":null,"work_id":"bf2a1cc2-229b-4126-82db-446f71e7dc22","year":2023},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:6b320ff00c55c5c316dacdc44eaf59c127430be7cc02d08d606faa462eb59021","observation_id":"04b7367e-3059-4e64-8e16-34d22b0b6b89","resolution":{"observed_at":"2026-07-10T16:07:20.613455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.546458Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages =","venue":null,"work_id":"aa7ee739-9981-41f5-8419-c4a9b98c12a9","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:4e12bb72442fb86dc7a4071607705313f5fc3aa852e21082f024f50159c87aec","observation_id":"44cbecbe-89e3-4a3e-a588-7c192c8a9c6f","resolution":{"observed_at":"2026-07-10T16:07:20.547835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.544230Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"8f8236b8-5757-4691-b996-4384d88b25f1","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:8b9e78055bb076ce9bfa87abe898cee846a2d53cb305f7ef9077ded87d7784c8","observation_id":"854a339b-c844-483d-8450-4c90eb41986a","resolution":{"observed_at":"2026-07-10T16:07:20.545806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.609809Z","title":"Scaling ResNets in the Large-depth Regime , journal =","venue":null,"work_id":"0fb4d736-ef7c-485a-b66c-11e6bf6102ba","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3d0685a7097b5cced4e08273b5c3894670e33577d17a7f25ee00edc92c1d171a","observation_id":"e5382b50-e944-481b-9f89-8e648a2537b3","resolution":{"observed_at":"2026-07-10T16:07:20.611211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-1130","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.52202/079017-1130","venue":null,"work_id":"d241881f-aad6-4b15-8717-55600c1d126b","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:479515ae582ce6c26a21debe110b9c662103f9b6d0356d6067d950be5505f23b","observation_id":"8be7c1d1-ac8c-43a6-b313-1d83b08f127e","resolution":{"observed_at":"2026-07-10T16:07:20.257203Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.628586Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"bcab77ba-394f-4f5d-ab8d-77abeab66951","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c151271d4c2a6ad41c757053f4bb8d07296994c90d0c1b75ed34c082047cc307","observation_id":"bfada41c-7cc8-47ae-af52-c37df463f788","resolution":{"observed_at":"2026-07-10T16:07:20.629956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3262","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Super Consistency of Neural Network Landscapes and Learning Rate Transfer , url =","venue":null,"work_id":"30fd7520-9309-471d-9e15-65bb288ba69e","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:224aad4f85541b1b9e8d377c254a6e102c01cd55e515d9be09805a679341cac1","observation_id":"0c2dcf6f-b129-4f30-bff3-be58607137a6","resolution":{"observed_at":"2026-07-10T16:07:20.249887Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.548548Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages =","venue":null,"work_id":"65945920-c075-4c04-98f7-1af7082ff69a","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:14fad5f331e0db6a12693776bb5ea7eb847e4e5585a3154f82dfb9fc51608883","observation_id":"b6636d3b-b8b5-4da3-92b4-879f77d677eb","resolution":{"observed_at":"2026-07-10T16:07:20.550520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.651794Z","title":"Tensor Programs","venue":null,"work_id":"8004f5b3-1a97-4064-8fbc-19db4cb2b83e","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:f846ac958dceab5678f58267da5f78b85c826026364668ed0dfc770f7230ecd6","observation_id":"bb609da8-58b9-4e95-b3c1-f6fab75a7a34","resolution":{"observed_at":"2026-07-10T16:07:20.654152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.641464Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"1ca85f3c-2f06-46d1-93cc-499435e72cd5","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:30db21101990bdd0d3ce37fc5eca58dcdeb1555f80bc9ad6d74a57d31333b0bd","observation_id":"964467f7-6524-4f2d-bd4b-506086066732","resolution":{"observed_at":"2026-07-10T16:07:20.642918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.541776Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"c7391707-301f-44db-9985-34066a900d0c","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:003392345918b9ba5b4cd4d14872c60b4bfbf741f91e3720aec502ed2bcbaea1","observation_id":"625120dd-4aa9-4ff5-bb31-0b5ddab44eba","resolution":{"observed_at":"2026-07-10T16:07:20.543545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.589405Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"f2bf4b55-d183-4a37-83dc-19b7fa199665","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:44b31b74e90a3ab441f3c5be57c0d077f756ddabb139b1ee6b6f015d7eab1ce6","observation_id":"bfeb656e-49dc-4958-ac4e-3d5d0ad6f6ec","resolution":{"observed_at":"2026-07-10T16:07:20.591135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.618474Z","title":"Proceedings of the 42nd International Conference on Machine Learning , pages =","venue":null,"work_id":"67e0a837-8bf6-4529-afe7-e5ab8187280b","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:92934dac245811e3596fa73cc32268ca4865a5ccce4e6a2cb7cb1bd516b65c7c","observation_id":"86c5296c-e948-4b2d-8ea9-14071eb25c66","resolution":{"observed_at":"2026-07-10T16:07:20.620548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.572789Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"51f112cb-03bd-4fef-ad23-66c66a578ed1","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:813c82645d9e6581fcd7d3a16cd6af6e689b95d4c5477bcdd87d7059a1f95ca8","observation_id":"1cff7f7d-b18d-4d5d-93ee-c4d68a0c0e0c","resolution":{"observed_at":"2026-07-10T16:07:20.574296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.577429Z","title":"2025 , eprint=","venue":null,"work_id":"07b9ebeb-cb80-4699-8af9-cd886aeaeca9","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:300fa1a80c275e8eb451deffe4712dd54e9b5954b833de4f4ed5dd25ae946a8f","observation_id":"e8cd5fa3-3c66-4e92-9a32-0a27643bdc73","resolution":{"observed_at":"2026-07-10T16:07:20.579023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.640500Z","title":"2025 , eprint=","venue":null,"work_id":"66023e69-9bca-41fe-bc3e-552ecfe2a564","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:e2dd0c22419b5168f8b45b45a85e3b82e39ec7851e2d4c2e8e9420f71934ec85","observation_id":"d08d0956-90bd-4334-accb-62310e375adf","resolution":{"observed_at":"2026-07-10T16:07:20.642388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.639006Z","title":"2026 , eprint=","venue":null,"work_id":"801bfbe1-112e-4792-9a49-81c9f0a5cb6e","year":2026},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c3686a7c198f3b29c2ebfd03ff33ad60bd530eefb4cdabdbb033f13fa703a9dd","observation_id":"9f486c21-df81-4f6f-8993-cd06ac6ae73b","resolution":{"observed_at":"2026-07-10T16:07:20.640679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":4,"verified_fuzzy":49},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.07884."}