{"as_of":"2026-08-18T00:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d54bd3b9aa3095aa6e45cc11ceaf61e84663ce59611bd84cab96e0c835ef8b61","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:52:07.444052Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1909.02625/citation-record","integrity":"/paper/1909.02625/integrity","json":"/paper/1909.02625/citation-record.json","paper":"/paper/1909.02625"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:08.149286Z","title":"Abadi, P","venue":null,"work_id":"0f13b198-69af-4269-b7b8-f097072b0484","year":2016},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.228755Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:5a2aa5cf326c4c4f60a3bb53f153fc3e132635be3ab688c8fa5ddac1321a3b70","observation_id":"8ee8b2a2-7318-46d2-a236-ac1ad58b91db","resolution":{"observed_at":"2026-08-14T04:52:08.154953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08164","last_updated":"2020-06-19T19:19:32Z","snapshot_observed_at":"2026-08-16T20:10:00.029699Z","submitted_at":"2019-01-23T23:20:44Z","title":"Decoupled Greedy Learning of CNNs","version":4},"cited_work":{"arxiv_id":"1901.08164","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.08164","snapshot_observed_at":"2026-08-14T04:52:07.695488Z","title":"Decoupled Greedy Learning of CNNs","venue":"cs.LG","work_id":"2ede815e-a6f0-4d78-b850-d6effa7e9064","year":2019},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.235361Z"},"links":{"cited_paper":"/paper/1901.08164","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:bfdff818b527650e9516dade53d0af540c7cf599e9d07c1ed4101b45674d7b27","observation_id":"408223c8-70c8-4a2f-8697-6e34d6cc8ef0","resolution":{"observed_at":"2026-08-14T04:52:07.702657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:08.132010Z","title":null,"venue":null,"work_id":"db1e2a25-6b8e-4c13-9caa-5fb11b310153","year":2010},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.241376Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:4d0f2ac268bcfeaa89980a7c08e9a9a424ad796888912f48ca1f4ed28d313ebf","observation_id":"554af8cd-47dd-4b5e-a839-71ccc9e9b5a2","resolution":{"observed_at":"2026-08-14T04:52:08.137534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01274","last_updated":"2015-12-03T22:49:21Z","snapshot_observed_at":"2026-08-14T22:20:04.562155Z","submitted_at":"2015-12-03T22:49:21Z","title":"MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.01274","snapshot_observed_at":"2026-08-14T04:52:07.248238Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.248238Z"},"links":{"cited_paper":"/paper/1512.01274","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:bcd9da7774cddf858af1855d2a35c2499ee3ae3f5baa807d8a0ffcd3ef881744","observation_id":"18046a39-a021-4fd7-bcde-ac98f7719b19","resolution":{"observed_at":"2026-08-14T04:52:07.248238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-14T04:52:07.253889Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.253889Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:a84ad7406bb947edf845a0fd282621718e78af3135634a92d3f849c0a5a6cbf3","observation_id":"523cafa4-c45d-4354-b49c-d983cf1faea5","resolution":{"observed_at":"2026-08-14T04:52:07.253889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.259425Z","title":"Choromanska, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.259425Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:924fe55bff3aec6f18545e75db04411a6a2fe879c1f3217e45ec07fff558ff14","observation_id":"d6849735-3343-4b69-800b-910f954ed6c1","resolution":{"observed_at":"2026-08-14T04:52:07.259425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.265400Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.265400Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:2a610245b06e78011b79f8588b6e7f0e7c50df4634dd26e07c141dfe0b37a1cb","observation_id":"5006c72c-a388-4545-b52d-d4f43f975b13","resolution":{"observed_at":"2026-08-14T04:52:07.265400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:08.092555Z","title":"Griewank","venue":null,"work_id":"abf844cb-7e94-431b-b7c1-81729840e567","year":1999},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.270397Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:98babfa3f12f1f05b4c6a24b9e9371f53d2f54bf2986f9202603dbb406a55d6b","observation_id":"9003c4f6-8124-42c3-9954-1626a285af0c","resolution":{"observed_at":"2026-08-14T04:52:08.097545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:08.075185Z","title":null,"venue":null,"work_id":"311dcc6b-cdd6-43fd-82c3-9dd4a6a2b9a0","year":2015},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.275824Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:807eb71460ab4a2bef567158dec08e8da46c09244ce8e445cf9229d863930ef8","observation_id":"6760c649-c7e4-4e9b-87bb-9e26d29f5eb7","resolution":{"observed_at":"2026-08-14T04:52:08.080513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:08.058393Z","title":null,"venue":null,"work_id":"4d1fac38-833e-47ea-af57-782b33be4880","year":2013},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.282235Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:de198312412fc51164eeab8cff0b0ecc52976ebcfa853df99dccc6046c80e3ea","observation_id":"229d0219-a854-4dd6-87cb-0bec82d0e07d","resolution":{"observed_at":"2026-08-14T04:52:08.063722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.287283Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.287283Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:28e276e7bd5bf02e21beccce776838fd80de144f169c84c011a34d89b08cb7aa","observation_id":"fd4b5c96-c28e-4c59-ae13-a29fb8c1da45","resolution":{"observed_at":"2026-08-14T04:52:07.287283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06965","last_updated":"2019-07-25T21:42:58Z","snapshot_observed_at":"2026-08-17T19:36:58.372516Z","submitted_at":"2018-11-16T18:43:28Z","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06965","snapshot_observed_at":"2026-08-14T04:52:07.293435Z","title":"Huang, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.293435Z"},"links":{"cited_paper":"/paper/1811.06965","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:f255db8678c8fe89cdcea378976e59e2428b0c54423135502bd61552778ba3a9","observation_id":"a2050382-ac2a-4e65-9a53-643584336b7a","resolution":{"observed_at":"2026-08-14T04:52:07.293435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:08.028326Z","title":"Huang, X","venue":null,"work_id":"21411022-9422-40d7-9bac-fe7ebc8014b8","year":2019},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.298738Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:6882e5ba17212014374747feb9b3090b23df5d5e25c1a9a9780ab6146e023a1d","observation_id":"27c14faf-94fb-41a4-88fa-7eaf6dd5366f","resolution":{"observed_at":"2026-08-14T04:52:08.033934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:08.010552Z","title":null,"venue":null,"work_id":"f5403251-68af-449a-a521-127350f10a0d","year":2018},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.304319Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:54ad80c841577507da24de3d025b02f9b713fc9a61839fc7a143749f3e370e6c","observation_id":"fef1fcb8-35e9-43e9-bbe2-91df7ee1afb4","resolution":{"observed_at":"2026-08-14T04:52:08.015650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.993264Z","title":null,"venue":null,"work_id":"ed50d6cd-6d3f-4f13-8d06-a09a4bbe62ca","year":2018},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.309484Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:e563d62c77055bbae4ab62d9f8e1c72dbbecd8d66f0508fe43d26fa29196d6b7","observation_id":"5f947af2-bf7f-4a99-be85-df8ce07fdce5","resolution":{"observed_at":"2026-08-14T04:52:07.998658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-08-12T21:01:12.961874Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-14T04:52:07.314267Z","title":"Ioffe and C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.314267Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:7e7d798415b00001020fc91eaf9eba992a53678b0837c36424b995261995303f","observation_id":"d02859e2-057b-471c-8d78-69f6ae23afbb","resolution":{"observed_at":"2026-08-14T04:52:07.314267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.977011Z","title":"Jaderberg, W","venue":null,"work_id":"b47f8f39-97db-4ead-958b-cd609689adc4","year":2017},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.320343Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:2a782493c2ef5439d673f5bbcc4a54a25d496664b91bc37a386e8142958f2dfc","observation_id":"48a172ec-006a-4f49-9247-d806e23b3d5a","resolution":{"observed_at":"2026-08-14T04:52:07.981999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.959627Z","title":"Kawaguchi","venue":null,"work_id":"3e2a26d6-c018-4e7f-af6c-cfaa8c2043a8","year":2016},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.325591Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:6baff8edf990983d1fa1903a2144dfda80e181207fbf84c3e50afe5f5aeb659c","observation_id":"13447f54-99c8-4a7a-9549-df7a9c241395","resolution":{"observed_at":"2026-08-14T04:52:07.965175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T04:52:07.330758Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.330758Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:07ace3dfc2d39247015de015c1c275bc1d03ba6268c50b27a40cc30abe2ff341","observation_id":"98cc2ce3-f639-440e-9dda-178ef868addb","resolution":{"observed_at":"2026-08-14T04:52:07.330758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.5997","last_updated":"2014-04-26T23:10:51Z","snapshot_observed_at":"2026-08-14T23:36:31.652827Z","submitted_at":"2014-04-23T22:37:56Z","title":"One weird trick for parallelizing convolutional neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.5997","snapshot_observed_at":"2026-08-14T04:52:07.336133Z","title":"Krizhevsky","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.336133Z"},"links":{"cited_paper":"/paper/1404.5997","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:5cbc7ba8374683a9038335824e224f5ceda6fd0941630f1a06099376cb357df7","observation_id":"fd1d835f-da5f-488a-86c8-0eb67b59f557","resolution":{"observed_at":"2026-08-14T04:52:07.336133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.341360Z","title":"LeCun, B","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.341360Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:6ee2edb680a4b7fe33cd9243a0406daae2bf61a85a9535b4fe72018c5f5b4639","observation_id":"9d1b87be-5b5c-4905-a240-28eafb03aef8","resolution":{"observed_at":"2026-08-14T04:52:07.341360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.931173Z","title":null,"venue":null,"work_id":"cac01e65-b313-4ab0-88ea-0de5d20ee4c4","year":2014},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.346380Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:3157f164bfa17340b611721a81013e0c2bcb03e5a6c7699d3a80fcfb98942d27","observation_id":"cba63bea-e34c-4732-b008-c83b111ee48d","resolution":{"observed_at":"2026-08-14T04:52:07.936358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.912435Z","title":null,"venue":null,"work_id":"0105cb14-cf08-4a1c-86ae-644d906961b0","year":2014},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.351562Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:231d7892a0b550e7a829f94cc7c3b47eea0c06fc68688f7a8dbc6347bd759eb7","observation_id":"1381c9b8-29b1-4685-a081-db9e7383e396","resolution":{"observed_at":"2026-08-14T04:52:07.919022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-14T04:52:07.357017Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.357017Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:20667e464734ad489c461aedfc4bb1e92c0fd248af597cd04f0d750795d443f7","observation_id":"49a69b94-29c2-446d-bcdc-153e4ddff226","resolution":{"observed_at":"2026-08-14T04:52:07.357017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.893968Z","title":null,"venue":null,"work_id":"8d7466c5-5d61-4aac-bb02-2af7c16eab25","year":2018},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.362345Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:95c35bb2ffb5d9cb2b29a9a9bd4fd2a87490693f5500fb6be097655cd0a6d7bb","observation_id":"1e37ec31-225f-4dfa-b951-8def70b307a1","resolution":{"observed_at":"2026-08-14T04:52:07.898998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05270","last_updated":"2019-03-05T05:58:11Z","snapshot_observed_at":"2026-08-14T18:15:55.919265Z","submitted_at":"2018-10-11T22:15:28Z","title":"Rethinking the Value of Network Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05270","snapshot_observed_at":"2026-08-14T04:52:07.367508Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.367508Z"},"links":{"cited_paper":"/paper/1810.05270","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:8db12ae0d125a223d382de3ea788e86e1aa392ce21a96514faf0000114f9b179","observation_id":"932341bc-33ff-403f-91e4-26824b7815e3","resolution":{"observed_at":"2026-08-14T04:52:07.367508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.874840Z","title":"Nesterov","venue":null,"work_id":"d768f45a-27ae-4f22-9885-ac51cd95f4de","year":2013},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.372797Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:cdb312892cb593baf391b65da370fa7e9956e07c60882ae1d998ed237cbda548","observation_id":"44432ead-87e8-43b0-873f-780b52cc9256","resolution":{"observed_at":"2026-08-14T04:52:07.880127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.857423Z","title":null,"venue":null,"work_id":"d4223e49-f1df-4c40-8ebe-96c9c3190f55","year":2016},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.378090Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:13a69bab0254e8e6b47f490d577d50581d0062c7516eee0d3367170a8fadb16f","observation_id":"2af0b7cb-2aad-4660-b90d-271f2e45b768","resolution":{"observed_at":"2026-08-14T04:52:07.863378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.839208Z","title":"Robbins and S","venue":null,"work_id":"c898d206-a11a-4640-be04-a0a33db7067c","year":1951},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.383154Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:a1622a2d465d555145af46d71d3ceb7656c6c04b3e08f8c46b160fef0db68d9c","observation_id":"55a4168c-58ad-473d-97e0-9bffef2ac780","resolution":{"observed_at":"2026-08-14T04:52:07.844321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.822627Z","title":null,"venue":null,"work_id":"792c95ee-9162-4939-8623-f9ce225dfdf1","year":1988},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.388566Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:f7e334e23984505870c517151fd3f2ccfbb175fd54c20b78773b1d449afcb681","observation_id":"a6975bd1-2370-4ad6-8c3f-87162da457ed","resolution":{"observed_at":"2026-08-14T04:52:07.827609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T04:52:07.393889Z","title":"Simonyan and A","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.393889Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:2822abbffa70db24c2102af06df80f78f7a385f2b7306d1719c1f75daa7216d0","observation_id":"7c471beb-9e33-4ffd-8816-13458e7ca072","resolution":{"observed_at":"2026-08-14T04:52:07.393889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.400055Z","title":"Szegedy, W","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.400055Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:0f0900b17cfefd0e8a65e1f535f4ad81f885cc572aa6a8c66cfc7b1a19a1b8e6","observation_id":"9e6f40ed-caee-4cdb-b9c3-951fdc13ce16","resolution":{"observed_at":"2026-08-14T04:52:07.400055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.790643Z","title":"Szegedy, V","venue":null,"work_id":"c1db39c5-2367-40fb-b2c7-797caf6e17df","year":2016},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.405759Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:7cfc178b38fddc42e8bf1533e0d04068c8d8205b537c8fa0cf98171600489400","observation_id":"54ca689d-659b-41ac-941b-478c9b419cd1","resolution":{"observed_at":"2026-08-14T04:52:07.796605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.772451Z","title":"Tamar, Y","venue":null,"work_id":"cae7c32b-be92-436f-b782-5e5708fee742","year":2016},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.412502Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:2c17f57b18be2cfcb29db7a3d493fe45a6cc6d1767f9b34a7cc09e485a557163","observation_id":"a515b254-d13c-49c7-90d7-e34e5a0762c6","resolution":{"observed_at":"2026-08-14T04:52:07.778940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.755491Z","title":"Tieleman and G","venue":null,"work_id":"49672a4f-ef2f-4495-858e-bcaddb84da0e","year":2012},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.421959Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:d7ff6d7341cd9ec7c7a543c463b2ad99a933275335c5e138875c0f6474be4a99","observation_id":"e44c85c7-989f-41c3-9f01-415efbcc457b","resolution":{"observed_at":"2026-08-14T04:52:07.761158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.737092Z","title":null,"venue":null,"work_id":"a421ed5e-be10-4737-95eb-a9275f4d9dfb","year":1990},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.427820Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:76dd67798dda18a9dc2d760d40866de22501e024c9117711789d21894d151612","observation_id":"19cfe533-de52-4b07-b367-eb4c0d3989c6","resolution":{"observed_at":"2026-08-14T04:52:07.742694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:52:07.717736Z","title":null,"venue":null,"work_id":"66c738d8-5227-4428-be7c-22494555d550","year":2017},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.433033Z"},"links":{"citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:c0b43edc22abc00d39634aa37fd5e83ef7946c671dff0e336b40a80ec5d0b443","observation_id":"c6151f0e-9d53-41e0-8aed-c2680c97cbbf","resolution":{"observed_at":"2026-08-14T04:52:07.723382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06695","last_updated":"2019-09-14T23:21:56Z","snapshot_observed_at":"2026-08-07T06:41:48.949096Z","submitted_at":"2019-09-14T23:21:56Z","title":"Ouroboros: On Accelerating Training of Transformer-Based Language Models","version":1},"cited_work":{"arxiv_id":"1909.06695","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.06695","snapshot_observed_at":"2026-08-14T04:52:07.505758Z","title":"Ouroboros: On Accelerating Training of Transformer-Based Language Models","venue":"cs.CL","work_id":"a5849f35-63b9-4cc3-991e-5d4b2f09f689","year":2019},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.438334Z"},"links":{"cited_paper":"/paper/1909.06695","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:e37f222c64a47f452be1e50fe0bb823cd25738ee3162483828ae1a701a1c85e4","observation_id":"602e68bb-cf6e-454f-82aa-f18f0a1a7bae","resolution":{"observed_at":"2026-08-14T04:52:07.514034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.03257","last_updated":"2016-05-04T23:11:39Z","snapshot_observed_at":"2026-08-14T22:02:05.975491Z","submitted_at":"2016-04-12T06:24:19Z","title":"Unified Convergence Analysis of Stochastic Momentum Methods for Convex and Non-convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.03257","snapshot_observed_at":"2026-08-14T04:52:07.444052Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:52:07.444052Z"},"links":{"cited_paper":"/paper/1604.03257","citing_paper":"/paper/1909.02625"},"observation_digest":"sha256:aa9a03543ed6ae775c9c70d3e022b05b735bfb5b4ccda4ddae350d920b29b84f","observation_id":"e8b2dad4-d2cd-4f47-b915-e36f0f65f037","resolution":{"observed_at":"2026-08-14T04:52:07.444052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1909.02625","last_updated":"2022-01-19T06:16:59Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T03:24:33.855629Z","submitted_at":"2019-09-05T20:41:06Z","title":"On the Acceleration of Deep Learning Model Parallelism with Staleness"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:1909.02625."}