{"as_of":"2026-08-18T18:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ea413555b388552b4d7350afb162b1cb73aa2491ce3755500b0e53bfb145e2a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:35:58.060389Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00982/citation-record","integrity":"/paper/2505.00982/integrity","json":"/paper/2505.00982/citation-record.json","paper":"/paper/2505.00982"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:57.901929Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.901929Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:e29797f5416b8b8b7eb31a882484b19cf562958502303edd4786286401a91da5","observation_id":"f82cd0a1-e4d5-4e35-8825-0cd7993c8243","resolution":{"observed_at":"2026-08-16T04:35:57.901929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.558479Z","title":"Resfusion: Denoising diffusion probabilistic models for image restoration based on prior residual noise,","venue":null,"work_id":"c3f85011-6589-4234-9869-8e34c264ba19","year":2024},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.906604Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:2f8bf6859135f9adcc668e6d9d63b710eb6d7b891a1e0b98ce44595cd768a2ff","observation_id":"04a91772-b86d-478f-ae62-8355fd89f511","resolution":{"observed_at":"2026-08-16T04:35:58.562852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T04:35:57.910941Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.910941Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:ad2e0cdaef399153f0fb01a6b23d5f4f947a220bf58fb66bfd1f9b6e5ae9fe9f","observation_id":"c8ff4062-ada3-4d97-9ac9-0af5e5305c3f","resolution":{"observed_at":"2026-08-16T04:35:57.910941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:57.915627Z","title":"Imagenet training in minutes,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.915627Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:23999de239bc205ed9e045434b5b12e7ac9654403eed688e95bc7e3285d04080","observation_id":"32c6d930-f6db-45be-8a33-96c28abab184","resolution":{"observed_at":"2026-08-16T04:35:57.915627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.538748Z","title":"Diffusiondrive: Truncated diffusion model for end-to-end autonomous driving,","venue":null,"work_id":"8296c7db-c30e-42ee-ab66-303cd73ead92","year":2025},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.920364Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:cbbbfe21aee2195f3cfa59ba3d59a3ae7e907e2c772e2b45139708681950d89c","observation_id":"4136fc88-43b9-46b7-aee7-0241748ab2a4","resolution":{"observed_at":"2026-08-16T04:35:58.542700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.526262Z","title":"Towards federated customized neural architecture search for remote sensing scene classification,","venue":null,"work_id":"551136a3-9604-4a10-b531-450abe548144","year":2025},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.926356Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:ef187df866588c8ddc19a8b592319a75c055112a7170cc58b565c406266a46c5","observation_id":"098f20e4-80b2-44f9-91f7-eba0d8dfadcd","resolution":{"observed_at":"2026-08-16T04:35:58.530513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T04:35:57.931169Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.931169Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:d9b0f74872389d9693a448faa7e583d024a61aa753eb0807cde94aae58fcb1b8","observation_id":"4216fc77-4461-4a96-98d5-ce37573aaa6b","resolution":{"observed_at":"2026-08-16T04:35:57.931169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.513420Z","title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent,","venue":null,"work_id":"30d5825a-5c05-4d83-b9d8-5a9dd32b13c3","year":2012},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.935450Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:7411421b33a8a5b3f416465bdc7105f6580e76533ad26665289731081b0c5905","observation_id":"73470cca-58f9-4dca-9d98-7af45bd1e587","resolution":{"observed_at":"2026-08-16T04:35:58.517618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:57.939127Z","title":"Optimization methods for large- scale machine learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.939127Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:886872ab5cd1fa3b5a5fcc600f19cd5c9bb6d5fa27df65283bc494fe646fa7cd","observation_id":"e8184d7b-5624-4ad9-b192-607cb8b27a7b","resolution":{"observed_at":"2026-08-16T04:35:57.939127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.491803Z","title":"Large- batch training for lstm and beyond,","venue":null,"work_id":"74d3f025-f972-48ea-aa6e-08c133e0de04","year":2019},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.942683Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:f12a82ba448b4561c3dc9af1d39186154fecdbf82cc3b62db7784db2778524f2","observation_id":"939d16d9-97e9-40fb-9487-c1e4766c4c45","resolution":{"observed_at":"2026-08-16T04:35:58.496855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.478152Z","title":"Deep neural network training with distributed k-fac,","venue":null,"work_id":"b7e9974d-3a4d-49f7-8e04-00b277817281","year":2022},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.946345Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:661076b359c83421c932517ae7238e20a0509942a112bd5b5a9a6d66449d678c","observation_id":"967bdf35-0b9e-408c-bc4e-79740397e8f2","resolution":{"observed_at":"2026-08-16T04:35:58.482325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-18T05:19:29.724501Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-16T04:35:57.949886Z","title":"A distributed data-parallel pytorch implementation of the distributed shampoo optimizer for training neural networks at-scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.949886Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:ef7a159d4636fa09b9f15b23b878d1cd670b82584332535b5cfc14201432466a","observation_id":"9b2fc8e5-cbe0-4a3f-9627-e9adc83f1ef1","resolution":{"observed_at":"2026-08-16T04:35:57.949886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.465925Z","title":"Optimizing neural networks with kronecker- factored approximate curvature,","venue":null,"work_id":"72b19ada-0a62-40fd-92d0-3a0539db64c1","year":2015},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.954154Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:254239402634ed2bb03848f53941adf6a5fdaac86212e0e6d0f3d2e892ee6bc8","observation_id":"d355ce0a-11ba-4f53-987b-82e93c31f8ff","resolution":{"observed_at":"2026-08-16T04:35:58.470009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.452997Z","title":"Shampoo: Preconditioned stochastic tensor optimization,","venue":null,"work_id":"decfe43f-ef18-4f47-9c78-d36ac52919a0","year":2018},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.957855Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:f08b222443f880a26159c639ceb5be63ce5e35727f2c2e1d5b991d1f04de731c","observation_id":"a14b3053-b592-4867-964a-a0dd62e4a85d","resolution":{"observed_at":"2026-08-16T04:35:58.457417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.440506Z","title":"Automon: Automatic distributed monitoring for arbitrary multivariate functions,","venue":null,"work_id":"5e36f2d3-e724-43ac-b834-226f1c80046b","year":2022},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.961570Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:ab3b3929dcf410969983f2cbe23f38332cd40f6eb22607f69176d1006e37afce","observation_id":"c67222e1-ff86-444e-8ffb-feaf77080358","resolution":{"observed_at":"2026-08-16T04:35:58.444636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.427949Z","title":"Fosi: Hybrid first and second order optimization,","venue":null,"work_id":"b280872c-8e78-4b79-a202-178d136b3738","year":2024},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.965195Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:24366bd8aa6c579c60a9fd736df0edeb2ed0114858949d230b9da392b22cd91a","observation_id":"fbab591e-eda7-4647-8308-64eceef0ee2f","resolution":{"observed_at":"2026-08-16T04:35:58.432171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:57.968920Z","title":"On the limited memory bfgs method for large scale optimization,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.968920Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:cc225e72d2a3e99fef77bb08bb6fa49c122f9fefc610fd159c69c18bdeb34a62","observation_id":"f74826c6-a80e-409d-99d9-7c39a29c2284","resolution":{"observed_at":"2026-08-16T04:35:57.968920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20096","last_updated":"2025-04-26T05:02:21Z","snapshot_observed_at":"2026-08-17T06:58:19.018432Z","submitted_at":"2025-04-26T05:02:21Z","title":"Towards Practical Second-Order Optimizers in Deep Learning: Insights from Fisher Information Analysis","version":1},"cited_work":{"arxiv_id":"2504.20096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20096","snapshot_observed_at":"2026-08-16T04:35:58.182125Z","title":"Towards Practical Second-Order Optimizers in Deep Learning: Insights from Fisher Information Analysis","venue":"cs.LG","work_id":"5137fe4a-0342-48ed-82aa-17c8d06f27ff","year":2025},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.972902Z"},"links":{"cited_paper":"/paper/2504.20096","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:85b5381d59c4fae586bc04935fef1b44e14e90fe23b27b13246ee6f905e0b359","observation_id":"5e6b71ba-4433-4fc9-9ab6-712b34b1295d","resolution":{"observed_at":"2026-08-16T04:35:58.186612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.406964Z","title":"Nesterov momentum based optimization algorithm for deep learning,","venue":null,"work_id":"e7e5c416-e2b6-432d-aba9-469086f2242b","year":2024},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.977152Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:329db998639a6333c394b6a43e4d8d89585329259ff019dd932e3c4174aca6b8","observation_id":"ff637452-467f-4e81-b79c-7f4b066536d4","resolution":{"observed_at":"2026-08-16T04:35:58.411208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T04:35:57.980873Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.980873Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:bd00a10f05b547db51a18286226005e69a07d340fbb36e822e55324378e996e4","observation_id":"4564236c-6a76-4563-9dcc-2beb845977f3","resolution":{"observed_at":"2026-08-16T04:35:57.980873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.394957Z","title":"An iteration method for the solution of the eigenvalue problem of linear differential and integral operators,","venue":null,"work_id":"f78ced1d-c1f6-417f-836d-179fdeb5776d","year":1950},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.985345Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:8db0e9976d2baa748001d805b9444c33eaf1d79d94e3a86c892d8b2977cb7219","observation_id":"0622c8ea-5aea-4ccb-9995-ae27003a58df","resolution":{"observed_at":"2026-08-16T04:35:58.398969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.381858Z","title":"Federated learning via inexact admm,","venue":null,"work_id":"fab5b6aa-6a1a-4f22-a698-b645bd450250","year":2023},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.989251Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:0794acd61185ca2eac5e235b043f477fb9548727f8d17c9dd0ae41baf4678282","observation_id":"d3bbcfd1-2677-42c1-bdeb-0cc5260033b1","resolution":{"observed_at":"2026-08-16T04:35:58.386530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.369531Z","title":"An inexact admm for separable nonconvex and nonsmooth optimization,","venue":null,"work_id":"c6a5c7c5-faef-40fc-ab8a-9f12ce7ec891","year":2025},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.993209Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:1106c9cd0793a0be6590869c1c150b9124d7f739efd71920814b25b8b6fa5d04","observation_id":"93f1d6d4-3966-4159-ba03-7bf21f1ed08f","resolution":{"observed_at":"2026-08-16T04:35:58.373656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.355822Z","title":"Newton raphson method,","venue":null,"work_id":"2ebb94b4-3872-48fb-bcad-b4c19304a9d1","year":2015},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:57.997220Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:e5644e7187eea1eea2def53d319b46197ffd7256d4f49a2b88b59ec5ba0c50ee","observation_id":"3195e879-76da-4430-8f80-49e97f8e19f3","resolution":{"observed_at":"2026-08-16T04:35:58.360743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.341946Z","title":"SOAP: Improving and stabilizing shampoo using adam for language modeling,","venue":null,"work_id":"8968474f-928c-49f8-a0ce-4102984b5751","year":2025},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.000926Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:d4635e0c49267f2c393856b09fe0b14e652e03f2c2c842fcf23d95ff739eabe1","observation_id":"1df4aa1b-8d06-44c6-b565-41476c66799d","resolution":{"observed_at":"2026-08-16T04:35:58.346558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.327995Z","title":"4-bit shampoo for memory- efficient network training,","venue":null,"work_id":"d3d6f94f-8382-42de-a5e8-ff1c7268e419","year":2024},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.005034Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:6325eaacf78ea527fc6eca8f4f0e7c7c07823b04a013148ec2562620344da9f2","observation_id":"e2d6d9d9-14ef-4ea5-85ad-aab5ca1c48e3","resolution":{"observed_at":"2026-08-16T04:35:58.332616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.314408Z","title":"Preconditioned stochastic gradient descent,","venue":null,"work_id":"6dbafba6-0d74-4d48-9919-ba0ae3d1ec97","year":2017},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.009061Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:e8803586e36ceb5b9f2ffcd839c0f2788e5c6a96c316536e100f4b40f71425b9","observation_id":"161519ff-73d8-4423-8ff3-24c5d3325839","resolution":{"observed_at":"2026-08-16T04:35:58.318587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.300179Z","title":"Fast exact multiplication by the hessian,","venue":null,"work_id":"5317da17-4fb7-4748-beb4-ca690a2cb29e","year":1994},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.012739Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:e834ac84bd289ba412085c5aba186922b65aa086e65490d40b521ada5d6329f6","observation_id":"755bd746-16ee-4e27-90f9-d90e7b1aa43e","resolution":{"observed_at":"2026-08-16T04:35:58.305117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03619","last_updated":"2024-01-08T01:22:00Z","snapshot_observed_at":"2026-08-17T13:00:12.982233Z","submitted_at":"2024-01-08T01:22:00Z","title":"AA-DLADMM: An Accelerated ADMM-based Framework for Training Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"2401.03619","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03619","snapshot_observed_at":"2026-08-16T04:35:58.152158Z","title":"AA-DLADMM: An Accelerated ADMM-based Framework for Training Deep Neural Networks","venue":"cs.LG","work_id":"a3e87abb-fc7a-4978-85f8-be4d67bd600d","year":2024},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.017123Z"},"links":{"cited_paper":"/paper/2401.03619","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:b74f32b6fa3b94b15be95a547e6d600fc40d1d35254a1dab574dd4cca52e3470","observation_id":"5430bcff-5ce3-4f35-bf34-202ebca4af90","resolution":{"observed_at":"2026-08-16T04:35:58.156628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10784","last_updated":"2026-07-05T18:06:30Z","snapshot_observed_at":"2026-08-18T17:07:11.406400Z","submitted_at":"2025-02-15T12:28:51Z","title":"Preconditioned Inexact Stochastic ADMM for Deep Model","version":7},"cited_work":{"arxiv_id":"2502.10784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10784","snapshot_observed_at":"2026-08-16T04:35:58.132146Z","title":"Preconditioned Inexact Stochastic ADMM for Deep Model","venue":"cs.LG","work_id":"12132775-7f47-49c3-8fe6-7923c5134c77","year":2025},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.021347Z"},"links":{"cited_paper":"/paper/2502.10784","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:0cd4866ad07ef21c64ca85094dec1d305339c3f718f87dabaa4a97723255372c","observation_id":"550cf32f-8c52-4fbd-a9e4-eaf6c74ea897","resolution":{"observed_at":"2026-08-16T04:35:58.138389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.287312Z","title":"A dual algorithm for the solution of nonlinear variational problems via finite element approximation,","venue":null,"work_id":"fa6e547c-a32b-4087-90bf-2f54db68fb73","year":1976},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.026067Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:8de5aab73ea496b04ff32859a2579e5da32c1c84680b223cffac241b07193409","observation_id":"75813759-f3f2-4614-b9ba-8bdcc41c67f8","resolution":{"observed_at":"2026-08-16T04:35:58.291834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.029972Z","title":"Distributed optimization and statistical learning via the alternating direction method of multipliers,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.029972Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:fa3d4766b40304ef6a1ef5cbb38b90402f93083660eb4e34054f7ed27706fda6","observation_id":"8c4d2f35-cd0d-4c00-87b0-b032d5c52658","resolution":{"observed_at":"2026-08-16T04:35:58.029972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-16T04:35:58.034077Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.034077Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:ba2ff0afc5910372954f0b469a4d7c29d57b40276dde480016730c2980108eec","observation_id":"b8a08be1-08b2-407a-93d8-059e32fde87d","resolution":{"observed_at":"2026-08-16T04:35:58.034077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.038169Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.038169Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:99f88c49529e13d24260c44a25f7f8cbfed2fcf4e77f9ebd69f646923fe84119","observation_id":"c26ddbe2-91cc-4d20-8f61-9023338ba0a5","resolution":{"observed_at":"2026-08-16T04:35:58.038169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.259171Z","title":"Tiny imagenet,","venue":null,"work_id":"b435052c-3fc1-41b3-8d37-baf15f9378ba","year":2017},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.042093Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:6cfbabc13984303c36298adc543f792b9aac98cb4775d2c15789aa0f31b703fb","observation_id":"38927258-dbf9-4cbf-b18f-e2f4e26db4eb","resolution":{"observed_at":"2026-08-16T04:35:58.263297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.246544Z","title":"Dct-snn: Using dct to distribute spatial information over time for low-latency spiking neural networks,","venue":null,"work_id":"dbf1b534-2872-4bdb-874d-35c82305138f","year":2021},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.046002Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:a325f4329dfac25daf793149c0ec594b6a485d1dc495c2db93bac4cad52f6c2d","observation_id":"bea35495-e3ae-4fdd-9ac1-ff3173c710b8","resolution":{"observed_at":"2026-08-16T04:35:58.250710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:35:58.233308Z","title":"Fedqclip: Accelerating federated learning via quantized clipped sgd,","venue":null,"work_id":"5453b959-dfca-408e-a8b8-b24f6d8173fd","year":2024},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.050937Z"},"links":{"citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:7bf5094ab76dbbd152f8fffb310274a0e2bece4fbf6a84e6d0fa1114f27cfbe3","observation_id":"b8f37a35-6c00-416b-9794-466f5b8e0db5","resolution":{"observed_at":"2026-08-16T04:35:58.237427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T04:35:58.055534Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.055534Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:92f30634bfdc602d0dec1853ef84502a14d1a6fe4507667202b355f8afe1028b","observation_id":"89423169-2734-4721-96e9-c1c93db93e50","resolution":{"observed_at":"2026-08-16T04:35:58.055534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.5997","last_updated":"2014-04-26T23:10:51Z","snapshot_observed_at":"2026-08-14T23:36:31.652827Z","submitted_at":"2014-04-23T22:37:56Z","title":"One weird trick for parallelizing convolutional neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.5997","snapshot_observed_at":"2026-08-16T04:35:58.060389Z","title":"One weird trick for parallelizing convolutional neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:35:58.060389Z"},"links":{"cited_paper":"/paper/1404.5997","citing_paper":"/paper/2505.00982"},"observation_digest":"sha256:2e53fd31416048c920ce2f89b61de5a8f357de0da7d367cab86aa014a36f0d5f","observation_id":"57277992-8131-4ed0-870c-bea3122d3f30","resolution":{"observed_at":"2026-08-16T04:35:58.060389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00982","last_updated":"2025-08-04T15:48:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T13:00:38.239741Z","submitted_at":"2025-05-02T04:02:36Z","title":"DHO$_2$: Accelerating Distributed Hybrid Order Optimization via Model Parallelism and ADMM"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.00982."}