{"as_of":"2026-08-06T01:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5b497bf1d6811a9b6d9356ad67318f62d28d588d7b94085e81267ccad03b9c1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":64,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:59:27.531983Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":509,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T21:38:59.970003Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/1904.00962"},"observation_digest":"sha256:d32cd83e1fa7f6f29cfa11cec21f0c4aea63b8434c6cc49c07a8f43507e69cb1","observation_id":"9cb22c49-6e9f-4d33-bfb5-b261ac09eba2","resolution":{"observed_at":"2026-05-21T21:39:00.060875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"1906.10822","last_updated":"2019-06-26T02:54:26Z","snapshot_observed_at":"2026-07-06T08:02:51.583780Z","submitted_at":"2019-06-26T02:54:26Z","title":"Gradient Noise Convolution (GNC): Smoothing Loss Function for Distributed Large-Batch SGD","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T15:41:27.232807Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/1906.10822"},"observation_digest":"sha256:0d16b055ede84c6d54aae5aaf81fb61e3ba9a481dad70a4138e6777a89e62978","observation_id":"1311239e-a50a-407a-8c4c-9e63160af736","resolution":{"observed_at":"2026-05-25T15:45:59.730986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T09:24:35.826882Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/1910.02054"},"observation_digest":"sha256:08ace3a6633300b47e7def95ef3760e03c5a69dacb2b06f2372855acf9ebb0cf","observation_id":"93bf0d58-8017-47f6-93a3-71a7943b59e0","resolution":{"observed_at":"2026-05-16T09:24:35.887384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-15T09:38:28.621842Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/1910.07113"},"observation_digest":"sha256:37b8cc7ba4ab9167ae08547dab2cf8d9112c533abb74eb45f607a9ca2a54f81c","observation_id":"bff25c17-cc58-4d49-a48b-490f377e4a08","resolution":{"observed_at":"2026-05-15T09:38:28.978739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-13T18:31:53.283456Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2002.05709"},"observation_digest":"sha256:eb3a85ca072354f47442b81e8bae254a5d8aa6b90de6c9e7f234b6e939e8e8fe","observation_id":"94dedb8c-ae06-426b-8262-7c30943c2e5e","resolution":{"observed_at":"2026-05-13T18:31:53.353223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-18T00:58:13.116663Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2102.01293"},"observation_digest":"sha256:f38240cba55698f1eaaf5138ed288ff1976742cec2fd5a94256f23cdfdd7776e","observation_id":"529719b8-9929-496a-bdf8-7c9b5c15a5f9","resolution":{"observed_at":"2026-05-18T00:58:13.495889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2105.04906","last_updated":"2022-01-28T12:23:37Z","snapshot_observed_at":"2026-07-06T11:08:17.373935Z","submitted_at":"2021-05-11T09:53:21Z","title":"VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning","version":3},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-15T15:29:28.776822Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2105.04906"},"observation_digest":"sha256:a091139a72edf22703df20264c0338bdd5c5fd4c603cfce2a8d8effa128598ee","observation_id":"43b6046d-a27a-4921-811b-d222bf9b1490","resolution":{"observed_at":"2026-05-15T15:29:28.894899Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-07-31T02:35:46.853381Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T06:53:57.519348Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2111.06377"},"observation_digest":"sha256:2330df7a88f9a3cf8fd38d3767b62a4b43c33c39ee746a5d70c1dfca6c42adb7","observation_id":"a773b300-cc4d-49df-ab69-af2a7dac7bdb","resolution":{"observed_at":"2026-05-16T06:53:57.559273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-05-11T14:22:57.925354Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2112.00861"},"observation_digest":"sha256:cbb09fa6d6e038bc5170705a441096a48b616b20f56354be03d57dfa2e3d2ea2","observation_id":"3f7fc28c-706e-4cac-9485-d546d62ff8ec","resolution":{"observed_at":"2026-05-11T14:22:58.919879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"reference_index":275,"source":"arxiv_source","source_observed_at":"2026-05-10T15:42:47.274448Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2207.05221"},"observation_digest":"sha256:78ae61ee8935f48d994e569ad38c5560a1294187c901844ebc153fff1a5ac5dc","observation_id":"d28d8083-a7af-49c7-8c93-f289aed0591e","resolution":{"observed_at":"2026-05-10T15:42:48.032070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-05T00:06:47.268747Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:4dd5224a1b19ee01f7eb85e742840e3f794b56333ef4b2a7ea007f74529501c9","observation_id":"3d146861-c72a-4e03-8cbe-6e256bb37de8","resolution":{"observed_at":"2026-05-13T09:41:38.263721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-02T05:40:31.086014Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-12T12:40:23.709098Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2404.08471"},"observation_digest":"sha256:af1e5f3ee71782d73236413359316f28db22c33ae670bdc0d54cae606b517b65","observation_id":"b35ec985-2ec0-4cae-a89d-2802e85bd033","resolution":{"observed_at":"2026-05-12T12:40:23.973006Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-02T05:40:31.086014Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-05-12T12:40:23.709098Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2404.08471"},"observation_digest":"sha256:b67555708e60b2fe2fe03b44407f4a6ef7970fb5977fc5012471b3b7c591a1f6","observation_id":"407ae796-a0b5-493e-9aad-65210c420069","resolution":{"observed_at":"2026-05-12T12:40:23.801636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"reference_index":215,"source":"arxiv_source","source_observed_at":"2026-05-21T21:22:36.870292Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2502.07529"},"observation_digest":"sha256:9cab72e7f75d7e285287e5ac174b75184c8ded690bf4dc647c3ddef007364e78","observation_id":"d15cf685-93f5-4056-9c13-7d31334ba6f6","resolution":{"observed_at":"2026-05-21T21:22:37.139631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2505.13196","last_updated":"2026-06-09T19:32:07Z","snapshot_observed_at":"2026-08-02T14:15:12.167650Z","submitted_at":"2025-05-19T14:51:40Z","title":"A Physics-Inspired Optimizer: Velocity Regularized Adam","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T14:34:37.468180Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2505.13196"},"observation_digest":"sha256:108bd2d77214da64a4e6c35e5a266778a111cdd3f0a8bc73a53263153862e97e","observation_id":"0cb11246-b373-4c03-b683-aeadd8269646","resolution":{"observed_at":"2026-05-22T14:34:54.229546Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T21:59:27.531983Z","title":"Large batch training of convolutional net- works,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-05T21:59:25.881062Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.531983Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:bb2f78ce059535f32a5bb4d56f7436a046e96dbdc6d762cc46130fb4ca5fe2b6","observation_id":"a1f2a9c6-63bc-434c-b70e-d4e9b35d6ff6","resolution":{"observed_at":"2026-08-05T21:59:27.531983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-04T23:34:24.631571Z","title":"Large batch training of convolutional networks, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.06535","last_updated":"2025-09-08T10:41:10Z","snapshot_observed_at":"2026-08-04T23:34:16.988495Z","submitted_at":"2025-09-08T10:41:10Z","title":"On the Reproducibility of \"FairCLIP: Harnessing Fairness in Vision-Language Learning''","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T23:34:24.631571Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2509.06535"},"observation_digest":"sha256:c983605df3327ec264dfce0404c02999c7a5758ac5e203afd58d6e5a68fbed9c","observation_id":"6b69d579-96dc-4258-9a3f-02eab965d4c2","resolution":{"observed_at":"2026-08-04T23:34:24.631571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2510.04606","last_updated":"2026-05-08T12:28:24Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T09:14:39Z","title":"Closed-Form Last Layer Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T09:58:50.815850Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2510.04606"},"observation_digest":"sha256:95a1db7292e20cd260f3e4ecb0a12455f1c915812b70306794c0a00d47b729fe","observation_id":"b9edcc1e-5cd5-493e-bc73-98be6fd1e637","resolution":{"observed_at":"2026-05-18T10:01:13.454551Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-04T09:38:46.832837Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.14717","last_updated":"2026-07-27T17:12:10Z","snapshot_observed_at":"2026-08-04T09:38:43.966098Z","submitted_at":"2025-10-16T14:17:38Z","title":"Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T09:38:46.832837Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2510.14717"},"observation_digest":"sha256:d6fbb606116135ba5a5a5d1d3e9d0db4e7db9a0199174e109d96fee40fb7cda9","observation_id":"ff8fd775-01d0-4378-ac00-102e61f6f019","resolution":{"observed_at":"2026-08-04T09:38:46.832837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-03T04:08:20.720337Z","title":"Large batch training of convolutional networks.arXiv preprint arXiv:1708.03888, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.05845","last_updated":"2026-06-08T11:16:24Z","snapshot_observed_at":"2026-08-03T12:54:34.865192Z","submitted_at":"2026-02-05T16:33:30Z","title":"Self-Supervised Learning with a Multi-Task Latent Space Objective","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T04:08:20.720337Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2602.05845"},"observation_digest":"sha256:04918558c4dc708baea39636e1dcd4cb832fc7be22b15b7d8a496d6d3ebf7f31","observation_id":"458c65d6-4e3f-4e86-bf90-5147e89a4716","resolution":{"observed_at":"2026-08-03T04:08:20.720337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2603.02667","last_updated":"2026-05-17T06:09:20Z","snapshot_observed_at":"2026-07-06T22:47:37.679205Z","submitted_at":"2026-03-03T06:54:19Z","title":"Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T12:15:57.019720Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2603.02667"},"observation_digest":"sha256:e3721febc9c7e3c15b532c1ecc7a156903c89df5678a1fcd988f8a54d016a035","observation_id":"86c4113e-abc7-4574-9849-6901a4b1bc8f","resolution":{"observed_at":"2026-05-21T12:20:06.963846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-07-13T23:54:54.872017Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.16164","last_updated":"2026-06-19T08:59:41Z","snapshot_observed_at":"2026-07-13T23:54:54.476893Z","submitted_at":"2026-03-17T06:32:41Z","title":"AI Application Benchmarking: Power-Aware Performance Analysis for Vision and Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T23:54:54.872017Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2603.16164"},"observation_digest":"sha256:36bff7ffd11c8f33977225e8b669697cc628854e0a91f1915efc4d397a28ccfd","observation_id":"3dc82b7b-110e-4a83-8a0c-fc2a11bfcd7c","resolution":{"observed_at":"2026-07-13T23:54:54.872017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2604.10689","last_updated":"2026-04-12T15:30:28Z","snapshot_observed_at":"2026-07-06T22:59:13.936436Z","submitted_at":"2026-04-12T15:30:28Z","title":"Communication-Efficient Gluon in Federated Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T15:16:15.739456Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2604.10689"},"observation_digest":"sha256:f0f99cc7d9e3a5f5f17c8256843531d99a8f1adeb1937249c03ba91aba39c0da","observation_id":"14291e2f-f549-4b9e-96b7-ea0014d8683c","resolution":{"observed_at":"2026-05-11T10:56:03.189861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:15d8c1ee50f1593ef93efa3255fec1b50d3f75bc6f4a31f260f946c751a94f13","observation_id":"05852816-1d02-49e7-9687-aca73fbcff49","resolution":{"observed_at":"2026-05-11T03:15:54.991024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.07815","last_updated":"2026-05-08T14:47:56Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:47:56Z","title":"OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:47:08.766380Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.07815"},"observation_digest":"sha256:093329881cbc1fe7867c9eabc66ec57f357fb5106bf6997191cdd6043f2a24ee","observation_id":"18b279e6-a61d-4ca9-b15a-30667080af38","resolution":{"observed_at":"2026-05-11T03:05:55.478901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.09968","last_updated":"2026-05-13T04:13:03Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:19:45Z","title":"Consolidation-Expansion Operator Mechanics:A Unified Framework for Adaptive Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T03:20:27.751171Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.09968"},"observation_digest":"sha256:1e195a90005a2a1bd397370f3855b34cd2899d69f055b7e8f1ddb9d3795ea8af","observation_id":"be0c4285-9882-4b3f-b5a2-3b5d56e794b2","resolution":{"observed_at":"2026-05-12T03:21:18.615137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.09968","last_updated":"2026-05-13T04:13:03Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:19:45Z","title":"Consolidation-Expansion Operator Mechanics:A Unified Framework for Adaptive Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-14T20:55:08.166991Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.09968"},"observation_digest":"sha256:d2c663d691107cac0b41e8bd608a337ae72eb7e7069bb462ec108b1cddb03ea4","observation_id":"c27bcd73-5a8f-48c3-812b-743f7a7382b6","resolution":{"observed_at":"2026-05-14T20:59:27.892999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.11111","last_updated":"2026-05-11T18:20:10Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:20:10Z","title":"ShardTensor: Domain Parallelism for Scientific Machine Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T03:03:32.316700Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.11111"},"observation_digest":"sha256:ba547ea09671a312cdd11d39a0895fc5dfd19f8a593fde718e4a801cb77b3145","observation_id":"c4c6cdf8-01eb-43f2-8a68-cc5bf37c183e","resolution":{"observed_at":"2026-05-13T03:07:09.069725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.11870","last_updated":"2026-05-12T09:50:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:50:11Z","title":"Information theoretic underpinning of self-supervised learning by clustering","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-05-13T06:22:03.439595Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.11870"},"observation_digest":"sha256:5376d3c9f89b6278d85074940d16e36aa313113f55d7d4010e3ff6273fed5f22","observation_id":"054a41a5-49a8-4afa-a1a1-181b840f75cf","resolution":{"observed_at":"2026-05-13T06:22:23.144321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.14345","last_updated":"2026-05-14T04:09:51Z","snapshot_observed_at":"2026-07-06T23:25:49.545418Z","submitted_at":"2026-05-14T04:09:51Z","title":"Convergence of difference inclusions via a diameter criterion","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-05-15T02:21:30.228735Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.14345"},"observation_digest":"sha256:d6f03e6dc8734d90de45f7f8e5951e08ed2c9a8ec5b8b6cb7d30316db32dee82","observation_id":"af435a0d-41de-4723-964e-87085347eeed","resolution":{"observed_at":"2026-05-15T02:23:31.753896Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.15530","last_updated":"2026-05-29T01:50:16Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-15T01:59:10Z","title":"Rethinking Neural Network Learning Rates: A Stackelberg Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T14:42:45.648114Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.15530"},"observation_digest":"sha256:8554888d35a16de80e12713697fb15337a43665b3186e85fa0dd076aabaea505","observation_id":"5992d4d7-63d5-4d7c-873c-51f9aa8fee84","resolution":{"observed_at":"2026-05-19T14:43:06.680507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.15530","last_updated":"2026-05-29T01:50:16Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-15T01:59:10Z","title":"Rethinking Neural Network Learning Rates: A Stackelberg Perspective","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T19:53:45.109784Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.15530"},"observation_digest":"sha256:e03e53db28b68adb8e6488659e91209bcd59961f972a117656d6fa0d661620b7","observation_id":"800d998a-0b4c-42c8-b31c-11643c796af4","resolution":{"observed_at":"2026-06-30T19:55:01.066572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.16017","last_updated":"2026-05-15T14:50:39Z","snapshot_observed_at":"2026-08-03T19:59:12.010055Z","submitted_at":"2026-05-15T14:50:39Z","title":"Accelerated Gradient Descent for Faster Convergence with Minimal Overhead","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-20T21:19:33.691048Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.16017"},"observation_digest":"sha256:4e9fa757a71813b811d81e14fd02e3bc24d628f275addc3bdb39c5af877ccc95","observation_id":"8ff62883-6c78-4b02-abf8-2d2bcaab760d","resolution":{"observed_at":"2026-05-20T21:23:44.641716Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.17671","last_updated":"2026-05-17T22:04:01Z","snapshot_observed_at":"2026-07-06T23:28:41.111402Z","submitted_at":"2026-05-17T22:04:01Z","title":"PEIRA: Learning Predictive Encoders through Inter-View Regressor Alignment","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-20T13:41:52.182460Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.17671"},"observation_digest":"sha256:ed143168dc915e084dfb09c8a97e0c8a43cc6c5ccc1437872f17f368c94e9d63","observation_id":"623c9667-4669-4c30-842f-f3ba9ee69d3a","resolution":{"observed_at":"2026-05-20T13:43:19.538540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.17787","last_updated":"2026-05-18T03:09:50Z","snapshot_observed_at":"2026-07-06T23:28:45.646975Z","submitted_at":"2026-05-18T03:09:50Z","title":"Revisiting the Adam-SGD Gap in LLM Pre-Training: The Role of Large Effective Learning Rates","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T13:34:09.129379Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.17787"},"observation_digest":"sha256:213bc700c3267692398079e9f7845d164549ec7bb39b5db0754ba353cbfb3083","observation_id":"c9aab725-fe4d-4406-a151-afae85ca14fc","resolution":{"observed_at":"2026-05-20T13:38:19.434014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:68c7bccb7285297f10ad3718304dbd44a0b957f1f7793de3e880ee5bf86e5b1a","observation_id":"ec4d4292-9a21-4a62-8103-029687114936","resolution":{"observed_at":"2026-05-20T09:38:11.041872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:1de94fdc42d61946644dea734920f9efbd6a20e5a2c97b042ebc850e5abd5ae6","observation_id":"5f476e18-4e91-49d4-ba50-ad5f99d69804","resolution":{"observed_at":"2026-06-30T18:45:00.321169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-20T08:48:42.019359Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:493d92e777e16c19b385bd5b69f036507acf612c1148f3ea33b45c271aff1467","observation_id":"dbfbd077-a323-4578-9cf2-f32a130551c6","resolution":{"observed_at":"2026-05-20T08:53:10.394204Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":2},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-06-30T18:27:40.390908Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:bf57334f34712bc23f9f7fd7d9374db40ebb28f38c6e95359de26017a9554dc6","observation_id":"7bb80b6d-5e53-4ad4-8955-0d2c87b7758e","resolution":{"observed_at":"2026-07-01T14:55:48.574590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.21557","last_updated":"2026-06-04T12:29:12Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T13:46:22Z","title":"Scalable Reinforcement Learning via Adaptive Batch Scaling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T00:21:15.933174Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.21557"},"observation_digest":"sha256:edd37ffa4eb2fc53ddda1c288b938c5c9db4165515077ea4a10543ecaf3901c5","observation_id":"838e2945-7c01-423e-9910-ec61d0994e08","resolution":{"observed_at":"2026-05-22T00:24:27.783480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.21557","last_updated":"2026-06-04T12:29:12Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T13:46:22Z","title":"Scalable Reinforcement Learning via Adaptive Batch Scaling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T17:17:59.698127Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.21557"},"observation_digest":"sha256:24ff5d50ce16d5aa8fad68ce9ab3ccd95b0e8df87e63a973aaa40e72cfe014ce","observation_id":"f0fdad98-32cb-48ae-9555-684aa36d4bf5","resolution":{"observed_at":"2026-06-30T17:24:57.645906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-01T11:19:03.524897Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T07:44:16.677054Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:f97dd1b21bb875c939619b7858cbcb51c1e5170c293882383e5ccb36628ef3a6","observation_id":"8121dd3c-5625-4345-8ac2-a40633c461a1","resolution":{"observed_at":"2026-05-22T07:44:42.670722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-01T11:19:03.524897Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:40d7b1ef2ac362487ba0fe81ee3a3f8078ce12b3d4eaf8ae99a8ef1551ab4df5","observation_id":"e9a303f1-aa0d-4451-af4e-933cde503842","resolution":{"observed_at":"2026-06-30T17:34:57.606238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.24316","last_updated":"2026-06-25T06:26:55Z","snapshot_observed_at":"2026-08-01T14:56:15.713802Z","submitted_at":"2026-05-23T00:48:36Z","title":"From One-Pass SGD to Data Reuse: Mini-Batch Scaling Laws in Sketched Linear Regression","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T14:09:52.456340Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.24316"},"observation_digest":"sha256:ce8c36b834cb122b44cfccb2c9db6c5806305dedfcb84642c4b739a06a580f26","observation_id":"7d506ace-a146-4498-8e16-6eba52ff7877","resolution":{"observed_at":"2026-06-30T14:14:45.590648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.26248","last_updated":"2026-05-25T18:15:27Z","snapshot_observed_at":"2026-08-05T12:04:21.559242Z","submitted_at":"2026-05-25T18:15:27Z","title":"Unified Neural Scaling Laws","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:43.393302Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.26248"},"observation_digest":"sha256:43f7e0ba72c39a7c651b618338b95a3f3b05e8e783185a192ac0f943010b3d65","observation_id":"cc81bd36-f1a5-4a6c-b1d1-240da1e3096b","resolution":{"observed_at":"2026-06-29T23:44:03.347192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:7920599a60e670acf0f7709b0f2291bd9acd6133df45ab9fe51bd069c5ae5c3d","observation_id":"02230bd6-51b6-4260-8d26-e487bbd9f6c0","resolution":{"observed_at":"2026-06-29T19:23:54.190890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.29494","last_updated":"2026-05-28T07:19:36Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:19:36Z","title":"Gradient Perturbation: Learning to Perturb Gradients for Adaptive Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T09:08:26.043300Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.29494"},"observation_digest":"sha256:7f121b5bf13621c17a6c36a231ebc4102f36d4d2547403b8715d441dc4eaac42","observation_id":"a9e6114c-9e22-4647-9159-63b926f1bb1f","resolution":{"observed_at":"2026-06-29T09:13:16.168939Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.05115","last_updated":"2026-06-03T17:20:18Z","snapshot_observed_at":"2026-08-02T06:45:34.348175Z","submitted_at":"2026-06-03T17:20:18Z","title":"Continual Visual and Verbal Learning Through a Child's Egocentric Input","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T06:40:26.958891Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.05115"},"observation_digest":"sha256:5ad4696f074a092f4916aa20a646410f079ba7e7b317b512ec9cfede2de309fd","observation_id":"a637fcf7-7352-472b-86de-0e33f0fab09f","resolution":{"observed_at":"2026-07-02T07:46:46.279821Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.08332","last_updated":"2026-06-06T20:50:04Z","snapshot_observed_at":"2026-08-03T11:31:08.875882Z","submitted_at":"2026-06-06T20:50:04Z","title":"SMI: Efficient Self-Supervised Learning via Mutual-Information-Inspired Dependency Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T19:41:51.921338Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.08332"},"observation_digest":"sha256:b93067c171c43c5abf028d99acbd2e99d4dac3d85c89fd5a8e4744357595fe3d","observation_id":"b3e8831b-0721-4f40-8f52-44bc08e9875e","resolution":{"observed_at":"2026-07-02T21:37:24.775934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.08574","last_updated":"2026-06-07T11:11:51Z","snapshot_observed_at":"2026-08-03T13:39:16.935988Z","submitted_at":"2026-06-07T11:11:51Z","title":"OrderDP: A Theoretically Guaranteed Lossless Dynamic Data Pruning Framework","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T18:26:32.883834Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.08574"},"observation_digest":"sha256:bd19ff12627a4485a1639a47ebceb337cd1767df3050b8bda74541f576860ed1","observation_id":"4e7db590-e0f2-498b-9b0d-8bca223e2b6b","resolution":{"observed_at":"2026-06-27T18:31:07.894671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.08574","last_updated":"2026-06-07T11:11:51Z","snapshot_observed_at":"2026-08-03T13:39:16.935988Z","submitted_at":"2026-06-07T11:11:51Z","title":"OrderDP: A Theoretically Guaranteed Lossless Dynamic Data Pruning Framework","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-06-27T18:26:32.883834Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.08574"},"observation_digest":"sha256:413cf9ea874a3c27e045e41a4b3fe532648b02ff89a2ca6054fb00075a38fcdb","observation_id":"86d8f0e1-d7ac-4474-afad-f88e45eab2ea","resolution":{"observed_at":"2026-07-02T23:07:27.215803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.11761","last_updated":"2026-06-10T07:37:01Z","snapshot_observed_at":"2026-07-06T23:50:49.040880Z","submitted_at":"2026-06-10T07:37:01Z","title":"RCAP: Robust, Class-Aware, Probabilistic Dynamic Dataset Pruning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T10:13:13.967151Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.11761"},"observation_digest":"sha256:32eb70a0d23ca7595a29be047e328afa6b8bf968017b732c0d4171a5b611906c","observation_id":"18a77217-3ce0-4da7-b72d-1d87a00024c9","resolution":{"observed_at":"2026-07-03T10:17:57.247646Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.19483","last_updated":"2026-06-17T18:14:51Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:14:51Z","title":"LEAP: Layer-skipping Efficiency via Adaptive Progression for Vision Transformer Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T21:07:20.133335Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.19483"},"observation_digest":"sha256:a1be8a4b4209417a4e7e64f567edf1989277a191325d4ebb6876506cc6fbb19a","observation_id":"417fe08a-3981-4f24-9677-20114c735241","resolution":{"observed_at":"2026-07-04T00:29:16.777414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-02T23:29:21.699637Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":2},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-06-26T09:19:50.623741Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:d1f80b7e3a1c2e0cf0d6244e67272b6a96ed83bfc0a6747a5e8f36d284f3eb1b","observation_id":"adaab7df-b61d-44d3-9c83-034cc7b6ce0a","resolution":{"observed_at":"2026-07-04T09:59:44.836737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-02T23:29:21.699637Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":3},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-06-29T01:18:19.195007Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:284346a9f2e9aae29ca535695ee9cba97a008d4d8032aa030c44f501ae25eae1","observation_id":"03497dd4-779e-458f-80a0-5f5623bb5e80","resolution":{"observed_at":"2026-07-01T18:55:59.454775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:79c47c30e379f26722dfd346b31fba5eda9f5be5025526d9d690509e1a8246df","observation_id":"92437153-2dd8-4055-a73c-30c1fa44165d","resolution":{"observed_at":"2026-07-04T20:30:07.628097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-02T10:14:13.181331Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:13.181331Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:1b5865f334f3f50a195dae5a1bfe2ed9972dc4e64ef356113ed3b99feda4e30b","observation_id":"f2ec9f3d-cd85-43b1-8b4a-1cd7605b4452","resolution":{"observed_at":"2026-08-02T10:14:13.181331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2606.30455","last_updated":"2026-06-29T15:22:32Z","snapshot_observed_at":"2026-07-07T00:04:20.023800Z","submitted_at":"2026-06-29T15:22:32Z","title":"Curvature-Weighted Gradient Diversity: A Noise Measure for Geometry-Adaptive SGD Schedules","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-30T07:31:11.050545Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2606.30455"},"observation_digest":"sha256:84344e3fc6fbfc5e8d72e02afa2d0cf3e1cfbf12c9b649999a6d6bfb6fd74faf","observation_id":"e144ee98-9f2e-41df-8229-d3b47777bab2","resolution":{"observed_at":"2026-06-30T07:34:21.500959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:b119317d4a8166f46c42f3f89914f21bf1a907536fd4758ebabfcdcd5b53ae06","observation_id":"3753eee2-05cc-4415-96a8-1515526e9942","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-07-14T10:29:19.000404Z","title":"You and I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10611","last_updated":"2026-07-14T19:27:31Z","snapshot_observed_at":"2026-08-02T19:15:21.395997Z","submitted_at":"2026-07-12T07:15:47Z","title":"M+Adam: Low-Precision Training via Additive-Multiplicative Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T10:29:19.000404Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.10611"},"observation_digest":"sha256:4e66c28265021615ff8232ce5807357e7084d3f8df82ff9dbe7972e1b9b669f7","observation_id":"3474dcef-4995-47ea-8416-90180d1f769b","resolution":{"observed_at":"2026-07-14T10:29:19.000404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-02T07:23:25.134837Z","title":"You and I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10611","last_updated":"2026-07-14T19:27:31Z","snapshot_observed_at":"2026-08-02T19:15:21.395997Z","submitted_at":"2026-07-12T07:15:47Z","title":"M+Adam: Low-Precision Training via Additive-Multiplicative Optimization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.134837Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.10611"},"observation_digest":"sha256:89542e2e09b8f5f5d5cfbdaa5976a3646c9f282c102d6c0b5ebd2a27fea88945","observation_id":"c1fa8d58-4a0a-457c-9ab4-62addecdba3d","resolution":{"observed_at":"2026-08-02T07:23:25.134837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-02T08:42:05.942052Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16268","last_updated":"2026-07-05T14:56:54Z","snapshot_observed_at":"2026-08-04T10:20:52.328452Z","submitted_at":"2026-07-05T14:56:54Z","title":"PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:42:05.942052Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.16268"},"observation_digest":"sha256:49ded3f77d2fe85baf1eb2323395ab9a7689497166b374e8fa9d09f2a2122a3b","observation_id":"9dc59862-e3ab-48d3-892d-784b945a2ac8","resolution":{"observed_at":"2026-08-02T08:42:05.942052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-01T20:29:59.024974Z","title":"Large batch training of convolutional networks, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16612","last_updated":"2026-07-18T03:23:21Z","snapshot_observed_at":"2026-08-05T11:07:42.391289Z","submitted_at":"2026-07-18T03:23:21Z","title":"Backpropagation-Free Trunk Training via the Split Forward Gradients","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T20:29:59.024974Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.16612"},"observation_digest":"sha256:75496dc61522a940fa73c4a525b5616527303432c9738a919c6dca01952b9af7","observation_id":"b23984c7-5cce-4ad0-a718-a220fb885fa6","resolution":{"observed_at":"2026-08-01T20:29:59.024974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-02T06:45:16.783035Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.783035Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:899fad370800344421ace6dba01f2f341ce735fe4f4f0da5c16f3c7673165114","observation_id":"f33cc214-6673-4722-a1a7-a122be0ab08c","resolution":{"observed_at":"2026-08-02T06:45:16.783035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1708.03888/citation-record","integrity":"/paper/1708.03888/integrity","json":"/paper/1708.03888/citation-record.json","paper":"/paper/1708.03888"},"outbound":[],"paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 64 inbound Pith citation observations for arXiv:1708.03888."}