{"as_of":"2026-08-07T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71ae7d49812eaf1923297ed84dc0dfe2f4847d494bd596cfea0216ec59d9c9fd","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T19:15:54.807005Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2410.15155/citation-record","integrity":"/paper/2410.15155/integrity","json":"/paper/2410.15155/citation-record.json","paper":"/paper/2410.15155"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:ec9e582b7f1bb2434fd9a789fcc266750d6afe6e4a62d7fc38a08d56f9f23acb","observation_id":"6045e214-2b4f-4278-bc91-981e313a5732","resolution":{"observed_at":"2026-05-23T19:18:20.788962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural network accelerator design with resistive crossbars: Opportunities and challenges","venue":null,"work_id":"6fa7f54f-fc43-4a40-bbaa-a64882c07ab0","year":2019},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:53e2e06aff5bdceec49171ee3cfab9d46ca88e2778774abc991b2d8d797318f4","observation_id":"7d13b050-6441-41ce-8094-bc92d7a8d74c","resolution":{"observed_at":"2026-05-23T19:18:21.621629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":"2006.15704","doi":"10.48550/arxiv.2006.15704","metadata_source":"pith","pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","venue":"cs.DC","work_id":"353279b8-3b33-45fd-9b64-41e5bd1708b9","year":2020},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:1138eac2086f69792ed35d86e6dd11755d66853db9035170d4ebeb9b5f4268d6","observation_id":"a5e0a058-9922-4814-9da5-acedb7b910a4","resolution":{"observed_at":"2026-05-23T19:18:20.784211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:22:38.135957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:22:38.135957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:c5ac314b20b01075e01ae7cbe2243137bfff1b89242ba169b23ccb08c8aa791e","observation_id":"b8fbd6f6-ac21-4c13-960d-547e05b61b19","resolution":{"observed_at":"2026-05-23T19:18:20.799974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large batch optimization for deep learning: Training BERT in 76 minutes","venue":null,"work_id":"d14bbbe4-df1f-48aa-8877-51bf0d8e0151","year":2020},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:ab22014a5712af574165ee299d73b8d89dd51d7f29ab606215798e4268387560","observation_id":"5975fada-e53c-4790-a040-d13cbc96361f","resolution":{"observed_at":"2026-05-23T19:18:21.610987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallelizing DNN training on GPUs: Chal- lenges and opportunities","venue":null,"work_id":"ed11c93b-3e6e-445e-ad21-996435dc2892","year":2021},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:c82dcb5977564f129b701cf8d3e9a885e772d23730311b87ed6746f26465314d","observation_id":"941109df-58c9-4c3c-8346-f8e6a1ecda96","resolution":{"observed_at":"2026-05-23T19:18:21.618109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Experimental demonstration and tolerancing of a large-scale neural network (165 000 synapses) using phase-change memory as the synaptic weight element","venue":null,"work_id":"e0a2dd6b-4402-4a30-878a-1a50de795a7a","year":2015},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:73fdafc8cf05a3bdf94d05fa501ef586d15ed1de274d054f4a649c2a9d6b4d5c","observation_id":"223c50c8-23e8-47a0-9942-9d710a3d7620","resolution":{"observed_at":"2026-05-23T19:18:21.607870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acceleration of deep neural network training with resistive cross-point devices: Design considerations","venue":null,"work_id":"0407d812-1a45-49f4-b59c-a3c4d5f8ed3e","year":2016},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:66d7c239568315e2f2d694d38cd29936267dbe68c03c4fc0861d03e444885748","observation_id":"10860706-e6ec-4917-a804-f339076a67d0","resolution":{"observed_at":"2026-05-23T19:18:21.597844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Algorithm for training neural networks on resistive device arrays","venue":null,"work_id":"1b85ebfa-7d05-43a0-bf9b-6b6e5fc491bd","year":2020},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:b119564e3f1040597ec504572b2f7b7a3a277f29eb1d5875dd530f80eac43c63","observation_id":"9640c866-ee75-48f9-9ca9-9794c79ce3f0","resolution":{"observed_at":"2026-05-23T19:18:21.594680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards exact gradient-based training on analog in-memory computing","venue":null,"work_id":"50677bf2-1ef5-448e-8971-9e226c87ba1a","year":2024},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:4379db212d7e33cf96432970e2a775829fd55643121638fa882d8627b3475bd7","observation_id":"f5f50697-2ec0-4dcb-b605-202ea61d9634","resolution":{"observed_at":"2026-05-23T19:18:21.604470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enabling training of neural networks on noisy hardware","venue":null,"work_id":"77b07f57-a949-4957-9f80-fe3a6ab141e9","year":2021},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:196e2bfef9d6982f968f267f409f07fedecf8381ecad3db7a2e4e65b332edc50","observation_id":"59643314-7d92-46fa-8e00-22636e4e34cd","resolution":{"observed_at":"2026-05-23T19:18:21.614092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04721","last_updated":"2023-03-08T17:07:09Z","snapshot_observed_at":"2026-08-05T23:22:40.960836Z","submitted_at":"2023-03-08T17:07:09Z","title":"Fast offset corrected in-memory training","version":1},"cited_work":{"arxiv_id":"2303.04721","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.04721","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast offset corrected in-memory training","venue":null,"work_id":"47d830f1-ae0d-405d-8405-e4777d86deeb","year":2023},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/2303.04721","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:c39acb2d98f73053a0ae49843c5c53175f9d31a41e65cec0d2856896ca18b189","observation_id":"3323db27-56b3-48dc-918b-5802471e0f62","resolution":{"observed_at":"2026-05-23T19:18:20.774412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural network training with asymmetric crosspoint elements","venue":null,"work_id":"48af3fd1-0f7a-4675-9498-0e1c1d0276d4","year":2022},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:c71c1c60490463b07df35ddd43ba02aacf95ce93813e3bd99442eaaa9b2f1370","observation_id":"0d9332f8-b6a4-4608-8a9e-d5e842ade84f","resolution":{"observed_at":"2026-05-23T19:18:21.662106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":"636c9071-e166-4914-918e-ca335de5b0c2","year":2019},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:0893091f662c384ad63c634bd2575a4028b6c37998d993543d681e5bb2212e10","observation_id":"565946c0-295f-4835-b669-8f4d700b9e0d","resolution":{"observed_at":"2026-05-23T19:18:21.666028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09910","last_updated":"2020-04-21T11:27:00Z","snapshot_observed_at":"2026-07-06T09:14:01.227657Z","submitted_at":"2020-04-21T11:27:00Z","title":"torchgpipe: On-the-fly Pipeline Parallelism for Training Giant Models","version":1},"cited_work":{"arxiv_id":"2004.09910","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.09910","snapshot_observed_at":"2026-07-04T02:39:24.645515Z","title":"torchgpipe: On-the-fly pipeline parallelism for training giant models","venue":null,"work_id":"dd4c1ae1-7618-40b2-b37e-8279c74e3737","year":2004},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/2004.09910","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:26e8a465e974d6349cdc3de480c4b0ac3c1c2bcbf9c19a9554d83842ad13cadd","observation_id":"6d41002f-63ff-4917-bd41-0c90d622bc63","resolution":{"observed_at":"2026-05-23T19:18:20.810027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-offload: Democratizing billion-scale model training","venue":null,"work_id":"e0757af7-1fd2-4c25-ba2f-ace9d14a509c","year":2021},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:7d474564acbd59fd3a8a3dbe576c3c3ac132a4cb1b1c0866328cdbe2b6c519cd","observation_id":"e8639a0c-122b-490e-a135-b73af85ed4a3","resolution":{"observed_at":"2026-05-23T19:18:21.669486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:9f19b434c6ea41f526de21b5eaca541d16c993d6b4e89ec732ad5f012e346114","observation_id":"572ed9ce-d888-4211-a562-39aa1b12c217","resolution":{"observed_at":"2026-05-23T19:18:20.805241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:9d679b2a404aee6244ac52c8d99796390cfc3dee430600eb33e575282f7e6019","observation_id":"fb5c6eb2-2b62-45cf-ac0f-ad96dadad573","resolution":{"observed_at":"2026-05-23T19:18:20.779225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Colossal-AI: A unified deep learning system for large-scale parallel training","venue":null,"work_id":"ffee144f-ddb3-4e61-8c7f-6603e6bf7c56","year":2023},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:ec3fa5e35cd444f1ff65077d427a71930829840f5197dbdcbfde65d1b2d3ad2f","observation_id":"5903b594-6c87-4e1f-9c98-8e52d5b85b78","resolution":{"observed_at":"2026-05-23T19:18:21.646721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pipelined backpropagation at scale: training large models without batches","venue":null,"work_id":"59314a9a-385f-41d1-9a50-c0ad4613e75f","year":2021},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:81b9bb470dc499ae2267cb1810a3cc2c67bfdec281d2db27ebf528c34c61c486","observation_id":"7e631d7e-cb7e-42fd-b0e6-086ed8ed09bc","resolution":{"observed_at":"2026-05-23T19:18:21.649876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pipedream: generalized pipeline parallelism for DNN training","venue":null,"work_id":"10f37d7e-362b-4633-abf5-a7ec7310ffe2","year":2019},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:c009c7f30079fc7b8e146aa4cbf846818d29cbfa2b88b864b1af2c82948e6b19","observation_id":"38f749c8-302b-44d1-b225-0bc55faae608","resolution":{"observed_at":"2026-05-23T19:18:21.652815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SApipe: Staleness-aware pipeline for data parallel DNN training","venue":null,"work_id":"f3075cf4-63e1-4781-b017-f98302d8cf3b","year":2022},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:30b0e2839da213c35f6a0ee985b4bf43aca4e4ded3342b7227109e6a1a767e54","observation_id":"2879146b-6b76-4803-ae72-70c2e8065d60","resolution":{"observed_at":"2026-05-23T19:18:21.655768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pipe-SGD: A decentralized pipelined SGD framework for distributed deep net training","venue":null,"work_id":"4c03d30f-1241-4f40-a20f-3c4aebe8fe65","year":2018},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:70f5a315a438b473a3345f1fcddb2dca27405ea23727124c5f991462bf476e42","observation_id":"ad27c476-f59e-44c5-941c-60d084951117","resolution":{"observed_at":"2026-05-23T19:18:21.601252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ISAAC: A convolutional neural network accelerator with in-situ analog arithmetic in crossbars","venue":null,"work_id":"5a14e4c6-f2e7-4144-bc25-34b5cfda5370","year":2016},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:9946e1e9b1fb332f8b2dd0d43ee05fe418e49ba7b7a27797841b666302f03a3f","observation_id":"9359de13-5cca-452d-b78f-2744fb707d27","resolution":{"observed_at":"2026-05-23T19:18:21.637162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pipelayer: A pipelined ReRAM-based accelerator for deep learning","venue":null,"work_id":"745d07ae-01ba-4034-bbf6-33c95f0537e7","year":2017},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:ba68051096fc3a0fdc1bdf8011a4943ddd1e5b4db748756288648911a4ce6459","observation_id":"490c0a34-d585-4716-a926-29402a436eb3","resolution":{"observed_at":"2026-05-23T19:18:21.640552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled parallel backpropagation with conver- gence guarantee","venue":null,"work_id":"949d124a-b7bc-4b19-a675-428643a5d2b8","year":2098},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:213b85905218c7ed924a6a561ee16a55a45e32094fc66d111c6e141296355589","observation_id":"4dd9077b-7fce-4add-82bb-e8324d65c813","resolution":{"observed_at":"2026-05-23T19:18:21.631128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overparameterized nonlinear learning: Gradient descent takes the shortest path? In International Conference on Machine Learning , pages 4951–4960","venue":null,"work_id":"5e33b541-bd2c-496c-8904-f8666bb6ffed","year":2019},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:ed7e4b265e4c6cecdd0922a979f166acfab8eb4d6399e9823c5087af321db5b5","observation_id":"7e4e0d4c-b70b-4099-9374-c0482c293db7","resolution":{"observed_at":"2026-05-23T19:18:21.673049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loss landscapes and optimization in over- parameterized non-linear systems and neural networks","venue":null,"work_id":"b03b32f2-d228-4e8d-b830-db70bb82bbdb","year":2022},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:4dc5232a9a859996ccc34d739daeb5289b74d375c5052c49bac85bbba98967d9","observation_id":"9bd67c44-bbe8-418e-bb17-e76752999d52","resolution":{"observed_at":"2026-05-23T19:18:21.628062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An improved analysis of training over-parameterized deep neural networks","venue":null,"work_id":"9cef9c75-1a3c-47af-a627-59adbe465543","year":2019},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:46c2d9dff3987503f1814e7a44169b423c3ebf9782f673b0972ff1a38bd723f4","observation_id":"f0a170ba-3332-4899-9bb1-07aefffbc260","resolution":{"observed_at":"2026-05-23T19:18:21.634072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization Methods for Large-Scale Machine Learning","venue":null,"work_id":"5e56141e-a27f-4424-8728-c022c5c85208","year":2018},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:fd69e7e0a1814b6e25378ba31bccff5a1671deea47322acf82a25b131948888b","observation_id":"ebf828d5-26af-4d1c-9a65-2913968664fb","resolution":{"observed_at":"2026-05-23T19:18:21.643547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A flexible and fast PyTorch toolkit for simulating training and inference on analog crossbar arrays","venue":null,"work_id":"27fb336d-c6d3-4431-b624-caf16ff34db2","year":2021},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:1711c9db019de335b9fc72574b62a84b636a40f1a6b5ac49d7c19c027662dda7","observation_id":"9cd4d463-c74f-4aa8-9d85-823a70829289","resolution":{"observed_at":"2026-05-23T19:18:21.658974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09430","last_updated":"2025-05-26T01:31:01Z","snapshot_observed_at":"2026-07-06T16:07:37.940200Z","submitted_at":"2023-08-18T10:00:27Z","title":"Towards Understanding the Generalizability of Delayed Stochastic Gradient Descent","version":4},"cited_work":{"arxiv_id":"2308.09430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09430","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards understanding the generalizability of delayed stochastic gradient descent","venue":null,"work_id":"cac08831-2a4b-4177-9c42-2e826e85aec1","year":2023},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/2308.09430","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:84f94ad34b1fc765cde9f074423ba98b0abfd41370b6487081f0c1fb3def4060","observation_id":"60fb2632-2a5f-41e8-829d-7b2227bbfbcf","resolution":{"observed_at":"2026-05-23T19:18:20.794826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training deep convolutional neural networks with resistive cross-point devices","venue":null,"work_id":"27e6ad82-67c5-43cf-8b8c-6633c2eab024","year":2017},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:41ecc6d1f94bd5b39c9da223c9c7e9c3151f6f9fb33f4d55b6d0a3767738ecc7","observation_id":"50f33d41-b458-486b-a9b1-ed3e6b5500da","resolution":{"observed_at":"2026-05-23T19:18:21.624595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09501","last_updated":"2019-04-11T22:39:27Z","snapshot_observed_at":"2026-08-03T21:58:34.348182Z","submitted_at":"2018-05-24T04:05:42Z","title":"AutoAugment: Learning Augmentation Policies from Data","version":3},"cited_work":{"arxiv_id":"1805.09501","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.09501","snapshot_observed_at":"2026-07-03T13:58:21.851521Z","title":"AutoAugment: Learning Augmentation Policies from Data","venue":"cs.CV","work_id":"9cfcaaf4-6f01-4522-b146-cf16d4be7b90","year":2018},"citing_paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:54.807005Z"},"links":{"cited_paper":"/paper/1805.09501","citing_paper":"/paper/2410.15155"},"observation_digest":"sha256:d6144df9bdcbdc937fc8498fc0aa3e2772da3ca5a9c1ec3c9dd2d6f82d01ae84","observation_id":"1b2a879f-ca77-4c78-8e17-65f77560074b","resolution":{"observed_at":"2026-05-23T19:18:20.769518Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.15155","last_updated":"2026-04-26T22:56:07Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T16:58:34Z","title":"On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":8,"verified_fuzzy":25},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2410.15155."}