{"as_of":"2026-08-22T20:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dae5b00ecae0cc091b171469dd445930c3f929f3a1850cf2979387d159c867cd","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:06:30.907678Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01997/citation-record","integrity":"/paper/2608.01997/integrity","json":"/paper/2608.01997/citation-record.json","paper":"/paper/2608.01997"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.880159Z","title":"Symbolic discovery of optimization algorithms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.880159Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:54b06c9ec045d25217d4e35ef8bb6496e729840afb44876b8710d7d8b4e3b0b4","observation_id":"b604f220-c841-4b74-87fe-31e149694b7b","resolution":{"observed_at":"2026-08-04T17:06:30.880159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.883038Z","title":"Sharpness-aware minimization for efficiently improving generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.883038Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:bf0f75f62df8f68c9a44ebdc634407097f59a772e1be2314899bd572772c60be","observation_id":"1b45874c-c83a-46af-926e-4efbff2778d9","resolution":{"observed_at":"2026-08-04T17:06:30.883038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09568","last_updated":"2018-03-02T00:12:58Z","snapshot_observed_at":"2026-08-14T19:41:57.164240Z","submitted_at":"2018-02-26T19:36:41Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09568","snapshot_observed_at":"2026-08-04T17:06:30.885131Z","title":"A unified approach to adaptive regularization in online and stochastic optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.885131Z"},"links":{"cited_paper":"/paper/1802.09568","citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:0ba35085dfd60360ed2cb930a7b42e124b7b7fcc0b98dc8e175969d8f5115636","observation_id":"cfcc3cbe-d1db-4d62-b856-d46f7cec3ecc","resolution":{"observed_at":"2026-08-04T17:06:30.885131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.887748Z","title":"Deep pyramidal residual networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.887748Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:6573085034ee5746822db9d214a24b1e1a01c558504752a7b51aa1d4b7e28969","observation_id":"93557d38-480e-4377-9f4a-147083dce4d2","resolution":{"observed_at":"2026-08-04T17:06:30.887748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.889690Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.889690Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:bc388c1b505c82d86d0c4d0cd2e5d80bdeda136cf26044c715c34845dc881cf7","observation_id":"8647a5d8-2b22-4818-89f4-7254ced5fa6c","resolution":{"observed_at":"2026-08-04T17:06:30.889690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.891902Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.891902Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:bfed2ee74be20ebebe4c9d78cd2cd0d73d9803d3992ab41e724eae03098b51de","observation_id":"45fe9ff7-ceff-471c-8739-0c0672b76f17","resolution":{"observed_at":"2026-08-04T17:06:30.891902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.894041Z","title":"Densely connected convolutional networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.894041Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:c5c466f24278d3ac32f3f6e5f84532ee9e231421fb9721f9d94ec3647d01847a","observation_id":"095ae28b-c1c4-4362-87f0-7e7c431a7888","resolution":{"observed_at":"2026-08-04T17:06:30.894041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.895846Z","title":"A stochastic estimator of the trace of the influence matrix for Laplacian smoothing splines,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.895846Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:057ac0bc76c859d3d48dfcf31b611d6df216fbdc02ddbed8958d5f6fe7e6d136","observation_id":"f330bf6d-4739-4d69-a312-8fde52d40b7f","resolution":{"observed_at":"2026-08-04T17:06:30.895846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07628","last_updated":"2017-12-20T18:34:08Z","snapshot_observed_at":"2026-08-16T07:35:00.867452Z","submitted_at":"2017-12-20T18:34:08Z","title":"Improving Generalization Performance by Switching from Adam to SGD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.07628","snapshot_observed_at":"2026-08-04T17:06:30.897575Z","title":"Improving generalization performance by switching from Adam to SGD (SW ATS),","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.897575Z"},"links":{"cited_paper":"/paper/1712.07628","citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:4a0ee690893118fbe1a2aa03fa296108e3a9c07070cf3cf08599597315fbdd8c","observation_id":"7eb49571-a360-48db-bd2d-0bf2df6fd825","resolution":{"observed_at":"2026-08-04T17:06:30.897575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.899602Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.899602Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:2932ae49ac82ef2195ca51c98849dba542eb3355c70258c61fc68815d38346aa","observation_id":"8668609b-4225-4213-a62e-4d02c0d3f09f","resolution":{"observed_at":"2026-08-04T17:06:30.899602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.901357Z","title":"Decoupled weight decay regularization (AdamW),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.901357Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:e9cb5638f2f33d33a74fefcade626af7daff1b91ecbd2975546cf3d852c6f374","observation_id":"080eff5e-78b1-4fde-9b7a-e15e001fb755","resolution":{"observed_at":"2026-08-04T17:06:30.901357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-20T11:22:33.275550Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-04T17:06:30.903248Z","title":"An empirical model of large-batch training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.903248Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:8fa00a946331c1b31f41e03fdf61ea5a9a94b6209a734c9c79d2b4b5f77d54cc","observation_id":"a808e2dc-a827-4ce9-86e3-263e8d0df796","resolution":{"observed_at":"2026-08-04T17:06:30.903248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-04T17:06:30.905493Z","title":"SOAP: Improving and stabilizing Shampoo using Adam,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.905493Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:3d9438d83dddf6d76c26f6c14be10f3de246201944f3faf84b1962fab3d5b962","observation_id":"3a4e0ecb-ee89-4cae-a2f7-cabbbc1c3d8f","resolution":{"observed_at":"2026-08-04T17:06:30.905493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:06:30.907678Z","title":"Lookahead optimizer: ksteps forward, 1 step back,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:06:30.907678Z"},"links":{"citing_paper":"/paper/2608.01997"},"observation_digest":"sha256:55bd3c0265ffebfd1e459974c7471a49473979b7902138b901a50039ea068015","observation_id":"3b655320-71db-47c4-8d02-0597fde4cf74","resolution":{"observed_at":"2026-08-04T17:06:30.907678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01997","last_updated":"2026-08-03T09:57:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T17:17:31.663856Z","submitted_at":"2026-08-03T09:57:50Z","title":"AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.01997."}