{"as_of":"2026-08-16T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49fef3ee000cc502b70593890d0d701f73d1abf4f6234b10eef240e96fc88994","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:56:20.157510Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.06395/citation-record","integrity":"/paper/1908.06395/integrity","json":"/paper/1908.06395/citation-record.json","paper":"/paper/1908.06395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.398518Z","title":"Katyusha: The ﬁrst direct acceleration of stochastic gradient methods","venue":null,"work_id":"2ad44b2d-c283-4a07-8ca3-77550ec0910b","year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.062637Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:d0c7df0ff7758a574824d0abae74f594579f23206c06e7dbab5275d6ff48184d","observation_id":"eeccf434-d01f-484c-abab-020c0610a1f3","resolution":{"observed_at":"2026-08-14T12:56:20.401443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.390767Z","title":"Improved svrg for non-strongly-convex or sum-of-non- convex objectives","venue":null,"work_id":"4d61ab01-8040-4fac-ab8f-ed9dc2f6ac23","year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.066368Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:16efe7c26c3345461fca78e71e9b43c05791d0b2a9a768aa58c7dbd9b631d1f2","observation_id":"15c4b2f3-b5c9-4442-b8cf-205045506f88","resolution":{"observed_at":"2026-08-14T12:56:20.393678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06509","last_updated":"2018-06-11T06:17:24Z","snapshot_observed_at":"2026-08-15T04:42:33.542161Z","submitted_at":"2018-02-19T03:08:26Z","title":"On the Optimization of Deep Networks: Implicit Acceleration by Overparameterization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06509","snapshot_observed_at":"2026-08-14T12:56:20.069173Z","title":"On the optimization of deep networks: Implicit acceleration by overparameterization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.069173Z"},"links":{"cited_paper":"/paper/1802.06509","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:79caf19421feec0d04f0dd1f80a95a82b885aa4872c59b8a48d817fe86760a87","observation_id":"9fdd86f7-dcdb-41c5-8538-3a6b4fe2c4d6","resolution":{"observed_at":"2026-08-14T12:56:20.069173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.382838Z","title":"Understanding batch normalization","venue":null,"work_id":"c481c1b6-4e30-4212-8c19-dee575717aa6","year":2018},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.072443Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:6f692862e7d31f9080557cd4c2e225895660e5b46d5b2f84935409cfdf4b68b2","observation_id":"13b11110-a481-45dd-bc92-2511c1a5f21c","resolution":{"observed_at":"2026-08-14T12:56:20.385621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04529","last_updated":"2019-11-20T16:13:56Z","snapshot_observed_at":"2026-08-14T17:45:13.644465Z","submitted_at":"2018-12-11T16:40:59Z","title":"On the Ineffectiveness of Variance Reduced Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04529","snapshot_observed_at":"2026-08-14T12:56:20.075139Z","title":"On the ineffectiveness of variance reduced optimization for deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.075139Z"},"links":{"cited_paper":"/paper/1812.04529","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:1516437779780bb85b4d9508a5b9ad1668a65c74d0e84bfa8d61a3ae680b1321","observation_id":"2585a2bf-102b-4f8c-b33c-a6c9bec45dfb","resolution":{"observed_at":"2026-08-14T12:56:20.075139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.375318Z","title":"Saga: A fast incremental gradient method with support for non-strongly convex composite objectives","venue":null,"work_id":"c7f08f10-0757-432c-95f4-bd12b6414cef","year":2014},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.078196Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:fd4179487d3598d58212e4dfd29b546875cd28aa69ef4419b4cdae23fd7143c9","observation_id":"b37f3ae8-a9d1-47cc-b75f-8109aa97feb0","resolution":{"observed_at":"2026-08-14T12:56:20.378208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.367343Z","title":"Accelerated gradient methods for nonconvex nonlinear and stochastic programming","venue":null,"work_id":"286b9770-e0a0-402b-ad3c-d1850aa2f936","year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.081124Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:ea04b6f2dac5a5e7be92e9df615911def2574afecc8ec1259d7ed047e47ac0f6","observation_id":"ecf2ef70-bbe2-4e88-af49-51442f4fa567","resolution":{"observed_at":"2026-08-14T12:56:20.370510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.083576Z","title":"Deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.083576Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:b880bccbebd3a7ccc807e3c2123011885822505136115024b682dfbf0733e088","observation_id":"c8493890-4abe-4bdf-8245-dedb836a05f9","resolution":{"observed_at":"2026-08-14T12:56:20.083576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-14T12:56:20.086161Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.086161Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:ad83377173d7b6102ce6b23b92dc6b07fd1ca6f534f12ed867155bfa839b8af1","observation_id":"def54e6c-5163-4fee-b2ea-d92afe92f331","resolution":{"observed_at":"2026-08-14T12:56:20.086161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.355947Z","title":"Stopwasting my gradients: Practical svrg","venue":null,"work_id":"5667f689-425b-4caf-9eb2-03567fa2efd2","year":2015},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.089230Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:28abbf3c6fac054d6330bfcadf94259c7932b9f2e6867523ccaafe305e23a51b","observation_id":"e78087da-772f-456b-aca3-d4ff600f26c8","resolution":{"observed_at":"2026-08-14T12:56:20.358757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.091834Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.091834Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:3eb3e0e1b53b19028cf668c019c0ba90059a82d49ef7aa8f31c7b1f962cd6bc8","observation_id":"7b3a1981-09b1-455d-89fe-8d6fba077940","resolution":{"observed_at":"2026-08-14T12:56:20.091834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.344240Z","title":"Train longer, generalize better: closing the generalization gap in large batch training of neural networks","venue":null,"work_id":"2b664154-9f9e-40a3-9ab5-6c21cfd6ef4d","year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.094440Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:8840de46f1f1f60735e7a28866902769d8baf4dcb2aa032fefbc6ff580474d6d","observation_id":"bade68b0-de08-4900-a859-719d44bc812d","resolution":{"observed_at":"2026-08-14T12:56:20.347293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.097087Z","title":"Deep networks with stochastic depth","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.097087Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:bb9be4ef75f253a1d8d4c89440acf244d134eab5e33e804317354828aa2f59b7","observation_id":"6ab70562-79bb-44de-b2aa-b0579ba5f4a8","resolution":{"observed_at":"2026-08-14T12:56:20.097087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.099551Z","title":"Densely connected convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.099551Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:efe6e09f4ea70fa9773641bdf0a205f88af921e6b0b2f3e94518100ef1f7fe16","observation_id":"01aaad5a-f115-4b3b-9421-1b160d2f3e76","resolution":{"observed_at":"2026-08-14T12:56:20.099551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-08-12T21:01:12.961874Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-14T12:56:20.102019Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.102019Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:3bce9395e30aa69d853582937fd9ae1477242ab8a4be27288c7cda122163f06e","observation_id":"e95e0c57-b4e7-4675-9e29-f01ede05300d","resolution":{"observed_at":"2026-08-14T12:56:20.102019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.328745Z","title":"Linear convergence of gradient and proximal- gradient methods under the polyak-łojasiewicz condition","venue":null,"work_id":"62e3d726-8530-437a-af4a-44799772ff60","year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.104886Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:029a9f3062692f044e61f0753383b121f445bc36036336fae43d921a7bfaca85","observation_id":"51eaa0bf-c206-4497-81a3-9b5499b03904","resolution":{"observed_at":"2026-08-14T12:56:20.331748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-08-15T20:45:29.277746Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-14T12:56:20.107320Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.107320Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:34ec2ac1caac63a2a08406c977ea380f4acf6ff2a760b365e2a759c3499212ba","observation_id":"03243838-ca4d-4a37-9d34-107ee5e13cf9","resolution":{"observed_at":"2026-08-14T12:56:20.107320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.110047Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.110047Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:c452dc4baa22f5a0f698fcbd13236aaaff371c01072a3e34ed3a908ff2208af1","observation_id":"5ff16e12-13f9-4117-948c-df290ee6a518","resolution":{"observed_at":"2026-08-14T12:56:20.110047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.112419Z","title":"Imagenet classiﬁcation with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.112419Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:8d5da945352b7f8797505e9ccfec67cb107291be51f4dbf5bd6fc5b79f3b6e5c","observation_id":"4b5f94ef-67ad-4501-909f-10a115668682","resolution":{"observed_at":"2026-08-14T12:56:20.112419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.313253Z","title":"Non-convex ﬁnite-sum optimization via scsg methods","venue":null,"work_id":"589791d7-edec-4b68-83d3-144f8dd7c007","year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.115022Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:79a79e9d0dd453835a2ece5748b1ebe90dce58b74d77a84429fe26ef1ceca2e4","observation_id":"3fa7504e-9218-4a3e-99c2-7caa7af0b15d","resolution":{"observed_at":"2026-08-14T12:56:20.316254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.305266Z","title":"Introductory lectures on convex optimization: A basic course , volume 87","venue":null,"work_id":"b6b2804f-f20e-4ebe-9718-b844aa50b4ed","year":2013},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.117519Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:73b22d059e97172680e11d2d252e431bac62ee1f18d42f772b20be25142fa1e1","observation_id":"1061e6fa-b21c-421e-95d3-09e3f30115c2","resolution":{"observed_at":"2026-08-14T12:56:20.308211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.120196Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.120196Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:476b62be9bfb1ab035eb319f08107f890f14f970ae3f225282ccaa20f747db76","observation_id":"c36acfa2-8cd4-4cab-82d7-b2fb7bed2c25","resolution":{"observed_at":"2026-08-14T12:56:20.120196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06747","last_updated":"2016-01-19T20:57:47Z","snapshot_observed_at":"2026-08-14T22:21:58.515154Z","submitted_at":"2015-11-20T20:27:45Z","title":"Data-Dependent Path Normalization in Neural Networks","version":4},"cited_work":{"arxiv_id":"1511.06747","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.06747","snapshot_observed_at":"2026-08-14T12:56:20.195477Z","title":"Data-Dependent Path Normalization in Neural Networks","venue":"cs.LG","work_id":"ab028609-037b-412e-a761-e1cb907f4ba8","year":2015},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.122539Z"},"links":{"cited_paper":"/paper/1511.06747","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:51fb47279f8cd7bfab754ce878170bb9de6edb3512b3967f27479e9fac272303","observation_id":"b7d8f731-2b0e-4979-90db-fa023abe1da8","resolution":{"observed_at":"2026-08-14T12:56:20.200955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.293479Z","title":"Norm-based capacity control in neural networks","venue":null,"work_id":"0ad66bfc-09c5-435d-b6c7-1e0fd43d79e6","year":2015},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.125371Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:d4b41b42ef84fa371981be55432df2579a0afb240a724bb55773f4bed69a347c","observation_id":"36b536ce-cc14-46ec-8baf-fb7aabe9d28f","resolution":{"observed_at":"2026-08-14T12:56:20.296647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.285960Z","title":"Exploring generalization in deep learning","venue":null,"work_id":"64c4cee1-515f-41e7-95df-6d173f4740d2","year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.127790Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:c6669aa10d73733b1b3bb35e5e61340528fd5d872a28c57d988c8c70efecec8a","observation_id":"4c9aee79-ee81-45c6-a603-a9d90fd6ae24","resolution":{"observed_at":"2026-08-14T12:56:20.288870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.130235Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.130235Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:97008dddd4af8e6b8951c58f528206ebc2dc2ba341111ab8fcdadc49508fe373","observation_id":"841df54e-9660-4319-ad43-6ab7b8f07696","resolution":{"observed_at":"2026-08-14T12:56:20.130235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.274359Z","title":"Gradient methods for minimizing functionals","venue":null,"work_id":"19d8b395-98c5-4f9b-992f-82cbd9059e52","year":1963},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.133220Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:eadbc347880dd55cfd0ea7be7e4136b72ee8ffadbbf691446f48a4197a37d92d","observation_id":"81685990-3cbf-4616-bcb8-138d74fd826c","resolution":{"observed_at":"2026-08-14T12:56:20.277168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.266968Z","title":"Stochastic variance reduction for nonconvex optimization","venue":null,"work_id":"7608a66c-ed7d-4d22-b47e-734fe494c268","year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.136176Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:3b78aa2de2204735541c69a144bf78add91744eb12295af49c33eb11a5220322","observation_id":"c3377c9d-1374-4ac7-a2bb-ac0c484a2cfa","resolution":{"observed_at":"2026-08-14T12:56:20.269694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.259200Z","title":"Minimizing ﬁnite sums with the stochastic average gradient","venue":null,"work_id":"735bab05-487c-4f2c-8681-39df791b7690","year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.138874Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:53a030eee805f0c96a25864dd1607e759b0adbd4a8a9f2a20f13601ab8154c0a","observation_id":"d1f05e16-8cb5-4973-b9dd-5af7f246759a","resolution":{"observed_at":"2026-08-14T12:56:20.262164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T12:56:20.141363Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.141363Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:0bafa3411dc49d156919913ebc5308c94782f47210c60976f94cb0543b547f97","observation_id":"e848cea4-85dd-4380-b594-20ed873e28ed","resolution":{"observed_at":"2026-08-14T12:56:20.141363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06451","last_updated":"2018-02-14T19:42:20Z","snapshot_observed_at":"2026-08-14T20:22:48.108548Z","submitted_at":"2017-10-17T18:08:04Z","title":"A Bayesian Perspective on Generalization and Stochastic Gradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.06451","snapshot_observed_at":"2026-08-14T12:56:20.144051Z","title":"A bayesian perspective on generalization and stochastic gradient descent","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.144051Z"},"links":{"cited_paper":"/paper/1710.06451","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:531927191339743d1c0e6c22daa4284ccbbfd1a60f99ae080b807802dbd63b93","observation_id":"cf504f9f-5d0a-4baa-86e5-f7ac7ad2276d","resolution":{"observed_at":"2026-08-14T12:56:20.144051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.147108Z","title":"Dropout: a simple way to prevent neural networks from overﬁtting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.147108Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:562e7f162fbaa034f5d17df4dc88981780ecf7e5247dd540d399e91d6d4b1093","observation_id":"fb353f36-9dac-425c-b01b-111008bf0ee7","resolution":{"observed_at":"2026-08-14T12:56:20.147108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.247632Z","title":"Training very deep networks","venue":null,"work_id":"6af26aee-d36c-408d-8cce-d1a1c76d20be","year":2015},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.149598Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:2f1cf015317c34557609595b6be4f6745103624633d36118c1a0f1b27979d99b","observation_id":"e2dd446f-560b-4dad-9798-8e23a8631b03","resolution":{"observed_at":"2026-08-14T12:56:20.250351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.152046Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.152046Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:e75d6dbfe2b6746f3b3515dbbc27704ab64222a5594c3b581ee38745e41e8c76","observation_id":"b38998bc-1f4c-4c4b-b696-27b0619a786b","resolution":{"observed_at":"2026-08-14T12:56:20.152046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07146","last_updated":"2017-06-14T06:06:48Z","snapshot_observed_at":"2026-08-13T10:21:59.687060Z","submitted_at":"2016-05-23T19:27:13Z","title":"Wide Residual Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07146","snapshot_observed_at":"2026-08-14T12:56:20.154538Z","title":"Wide residual networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.154538Z"},"links":{"cited_paper":"/paper/1605.07146","citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:883a0e51ca6f57a03b42eb7fb1f519d48b2978b9ce2a787d657260e233497bbe","observation_id":"934a11fe-922c-4114-8fc8-efe5ee471ce7","resolution":{"observed_at":"2026-08-14T12:56:20.154538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:56:20.236015Z","title":null,"venue":null,"work_id":"2756620e-f53e-46af-8dd9-a890f3f81de8","year":null},"citing_paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T12:56:20.157510Z"},"links":{"citing_paper":"/paper/1908.06395"},"observation_digest":"sha256:309a3144ce90bf19a5c56a0bf237fcd2401200884f523ac7b49f71e85cfbf036","observation_id":"445e25ae-3f2c-45d6-a486-41a8833e9e1b","resolution":{"observed_at":"2026-08-14T12:56:20.238718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.06395","last_updated":"2019-08-18T08:12:03Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-15T04:43:15.264033Z","submitted_at":"2019-08-18T08:12:03Z","title":"Towards Better Generalization: BP-SVRG in Training Deep Neural Networks"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:1908.06395."}