{"as_of":"2026-08-09T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bef01c74cb3fd1ea98dc33d14a015bb17d1c6789d55a1712ab569c94c7277797","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T18:00:57.430970Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.13894/citation-record","integrity":"/paper/2606.13894/integrity","json":"/paper/2606.13894/citation-record.json","paper":"/paper/2606.13894"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6e7448b2e9c2dda76c38301cdee66c732e415386e8973d9f24768ee8f2a72b21","observation_id":"8f6812a3-4454-4bfd-bcee-ffd30c9aebcd","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Np-hardness of euclidean sum-of-squares clustering","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:3b2e5e729ab397cef394e4eeb73d72755e9b326c40bfad1fadd51f6dee982514","observation_id":"c2f47ac6-a85f-4320-afec-3bf69847f0ec","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Memory efficient adaptive optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:cf95674b26e23f4a06ac1c403ae2be2c7ade9b3601e56cadecfd6e5925e8a6ae","observation_id":"0225f9de-8db4-4f62-bc51-1276a8e01be4","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"An iterative algorithm for computing the best estimate of an orthogonal matrix","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:a7128fcbb24554d6580c95b1f056a52cf9efa99bc0a72e6219cca862927bf6c6","observation_id":"e905a720-760c-43b2-9bb4-4c07ed4b5072","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:2cd27d5f1a2895dc63105a186b60aa7b2dd25f6bee6f7687958df66202b33391","observation_id":"6addacb6-fb40-445e-88ee-5488e8c2b6b0","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Large scale machine learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:69b210770bcbcc7661efd7dc27b579aa5bd09316bffe45121b2b0fa01346ed6e","observation_id":"138c125e-e36b-4b27-a69f-e2f71819bc1b","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Random projection trees for vector quantization","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:88832b2d0daeefd67b0c8ed69694514d894fdbeab1953d33e348ca2a8849cc73","observation_id":"9275a8b0-2b7f-4f83-b4c4-bbdf9445317f","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:a11d75ee4691d8e52adef1b04eb0f1146b63ddb3c9bc555ec46c3176a7c88d74","observation_id":"7f1d67dd-c340-420d-a4e5-e688e4d951aa","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:519617b9ba8937a1bfb31f2de0cfb97d2941fcd0ab4a2b6f6def62450eb90f66","observation_id":"85af1874-7e65-4b84-a222-377e963a6480","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:c6d1e4a7e6105b9aead09a181e6f76bfc393bb5f1f0665be81c4cc7519595efb","observation_id":"b738f9bc-0791-46c1-9ef0-ff202bf5098e","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:ebda1769a93b5fe84f72407256fb293e92e736a65909136b0534d71247ee77d6","observation_id":"46c78d12-1f4a-4c5f-b52f-c1ed39ab3028","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Functions of matrices: theory and computation","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:2a0352aac2cf76ef72eaf6159a9bce6c7bc682c19a3831b550448daac9019d48","observation_id":"2afd527b-6ce6-4128-b845-97041a9884ff","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:c347c7df6e4b3bb3184248fd7032bd0685db67ff133879613ead152876cf9c60","observation_id":"39f95338-3a1f-407a-ae8c-b729621bd3b0","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Zo-adamu optimizer: Adapting perturbation by the momentum and uncertainty in zeroth-order optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:1053c21b95c3cc6c7e61741c15c92945f82503a9a55eef95c08607ef6faf8f77","observation_id":"e664e3f3-3c39-41b6-b44e-141b42191c9e","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Muon: An optimizer for hidden layers in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:893e0b54004313d79492fe79f43765df72721c17d0ac64b1793c644e970c279b","observation_id":"79dd8bcf-e7dd-4c91-a95e-dc2f008cec7a","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:fae8c4bc60c6d750363d1e65530af4f697df64d3d17d8211eb7c13547eb85539","observation_id":"a32e3a7b-2029-4d69-954e-3b4b4117c1db","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Numba: A llvm-based python jit compiler","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:817dc6bca3e8f158cae51f172ecfe77906110d56ab2de114968888d5e6dacfe9","observation_id":"e91f4ac9-2b52-4113-a981-9b87bbb1629e","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Handbuch der Lehre von der Verteilung der Primazahlen, volume 1","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:92433ddcc0a31aab0a1856f691aec0cb4afa5d6a986894d343d65ccbf2be87cd","observation_id":"93e98d3b-50b4-4fb5-9fc8-7fefd1d0c5f4","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Memory efficient optimizers with 4-bit states","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:11f3afd5f79e970e76329c1e3f86d1aa30a119f338ceb4e813feb5835aa48db5","observation_id":"e346bb63-7be6-46af-ab0a-7518ac7a6f71","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:4cf929feef3efe1457f2ca2cb443c0c0763a93b1c4f31121f4295098798d16e8","observation_id":"12d9afed-7b30-432e-bf15-f0404ee74fff","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:c20fd05f2bd9c119d0096fedf742bc3bd29121c0d7ee429a27789ed84c2cefa3","observation_id":"53b75470-b39b-4710-8957-bbb1912ef668","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6d657d7e39b36640ad8a8f7d794e1d4853fbc642b755c82982aed65089ecdb24","observation_id":"b1f6cced-5322-48ce-b26d-fb8f758078ce","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Sparse mezo: Less parameters for better performance in zeroth-order llm fine-tuning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:cd61f70116c2c9f75633948c1df69257011c609c4f339509de13c79060920d78","observation_id":"a6e52bf2-2449-4e61-8172-99449d7880ae","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Least squares quantization in pcm","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:852fe90a984149b004322cf10d1424fea2244fd93a31f03049c8ca8e7214ce39","observation_id":"a0a4ab07-0fe3-41c5-9579-e3224fce9301","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:91b7dfc17a8c6dd7bf6b580f31453ac5b5e4c47af2fa0214e7e13c2b6a55370f","observation_id":"384d3efe-73ee-4b0b-80ee-b4ea6a2c5371","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"The planar k-means problem is np-hard","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:9e5a27014681efcb2be1dd0a9b2080883b2a610c3b7fbdbc7e5afde1312158eb","observation_id":"6f4ae7f8-35a7-4896-bb2b-a240ec3158c2","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Fine-tuning language models with just forward passes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:8fb7fc06525126449ebb96e5edfe03934fb4fa1a215e0737a79861088936f263","observation_id":"f6d9402a-3cf0-45ca-a119-0dbbf7d585c0","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Quantizing for minimum distortion","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6d8d144827c621c85da2adc442c7e2c94d605a6ebf29de0e1e8d1180adb78769","observation_id":"ecbfbafc-18c0-4c9a-b0a6-a714d1b41c35","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:ff6e8d9168941fd9b5be90232b0462155b652a2c039bc85b8ba3fe7867d6a8e3","observation_id":"5730d76e-5a39-4a69-9f6c-78f49350b1d6","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:64193ed50a2dcbe0b389c46b7a6bf83211669f56c62fd6bb486991b8777538a8","observation_id":"93746005-a7cf-4b2b-988a-c35dae172d84","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"On the convergence of adam and beyond","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:54cc1b8728b41198ded33835e1b7df23cca90b76df37af59cfa4a39034ecc971","observation_id":"97d9e0c7-af1c-4dca-bdac-53ace300bc35","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:a83e17814c2ffef7c459577ed128a8fbb4dfd26a879371b8ac1488d9182b80e2","observation_id":"dc38fdc9-6abc-4449-80eb-fd26e2a18c28","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6a0bb9e31b6f872115577680a7e2456316a3b541c9f2c1a501662846be59bdf1","observation_id":"f7590544-3a80-4563-ab13-4e103d6206be","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Multivariate stochastic approximation using a simultaneous perturbation gradient approximation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d75b4c5f7e0d2f43f8adab507eb3f8091078449a876cdc36dd4541a28b1e697e","observation_id":"45cc02dd-fccb-4bc6-b562-1ef0e63187ae","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"1-bit adam: Communication efficient large-scale training with adam’s convergence speed","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d787d9182fe572d57b5a7fa0c2ad3702111db37dbeb9f550ba81a38dc50b466e","observation_id":"13eb5fb5-9d7c-4189-986c-97ba772a70f4","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Lecture 6.5--- RMSProp : Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:55c0045b57a49ba0ae034e76c8febe8bb5f4f3ce7ac82c26264940d0c5ce8ff2","observation_id":"a0def7a2-7aca-4364-909d-8f88fe67ca3f","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:659c8284f3b50de54bd015e954bfe7dafce23c6c5d68b5f94f6d8d6df3ae3328","observation_id":"6f360add-e4f1-4494-9d19-7baad823e969","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adam-mini: Use fewer learning rates to gain more","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6f28e9b17cb9b192fb1698517df1375e2270cd67f4caa73bd9258ae629f60564","observation_id":"5da9ef35-bc49-46a8-be24-38904db5e7ca","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:3c310d3b19d00c7da6be0cdf56ae049c94c33f12a19fb881d0e1b8da5aecf044","observation_id":"12e0b49c-c5d1-4adf-b3c4-8ec2f3132834","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Pan, Zhangyang Wang, and Jinwon Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:a8d5c2355b345b73955bd07947e16756646460affe79dd05e8a82db55faed1b7","observation_id":"fc6b2427-7f56-471d-a466-d846900c002f","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:8f9029e1f63549f26c02a9de53ae9e4e90201d9d57f70d7c60b091e59dc5cb42","observation_id":"34ebc49d-2bf2-4fb1-9bff-3ff7bc54e8b8","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:ee35264e60260028de6fa1fd94042ac43aa6e2ed131f92a642068216e5f07b7e","observation_id":"21d9ae32-dc5c-42b5-919a-7e4239de7ae7","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"attn\" and","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:4443b68bb33f07936c7a3b2c37d1d953775a8dd1d5cbc02425e1e4985d0cd599","observation_id":"155e95a1-6711-4e44-9138-24f0b0db2745","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2606.13894."}