{"as_of":"2026-08-12T05:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce757175c90a528239570ac3f33fbe821a0d30ccb213075721eb6c8448c47e3a","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T04:17:58.962415Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09266/citation-record","integrity":"/paper/2607.09266/integrity","json":"/paper/2607.09266/citation-record.json","paper":"/paper/2607.09266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"W., Pfau, D., Schaul, T., Shillingford, B., and de Freitas, N","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:de328b2b25fe4aba3b6efe0212442e20f6a94002dda62b4f0b8695903f41dfe0","observation_id":"8cbeb75d-54bd-407e-b200-5cb587aa8cc2","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"signSGD : Compressed optimisation for non-convex problems","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:09a50dab6916cf6ba1dc807c276bd9ba0667d9e39d5c857795ac45db56f5b76d","observation_id":"a25c34a1-1b4b-42a0-934a-2484819e7bfd","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:db99ed32fba95bd18f0239f63d83d7bc054fb82a524008300afb4c0f6946cfd2","observation_id":"5bdcdcfa-fd1c-4836-9257-62c448bfac8e","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Z., and Talwalkar, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:9cb1c5df5e048539bcae986791e2b9c0f35903a0d13af2a6d80b1bce8cf11492","observation_id":"f6d98635-3bc1-4f66-bd4a-12b8920293a5","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Mishchenko, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:344c1837540b8e449dbb55a660ebcde49df10c7aff8e05cbbabd3874af1cc613","observation_id":"70787327-038a-456b-bae0-314679f04184","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"The road less scheduled","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:80b5b442f2fa076968b6f3da4578a44cca948a3cd92dbde8881fd7666de11fd2","observation_id":"c3eef540-d207-4514-83a2-3e8c98749e23","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:d6b30ecf35fa0db42258ae93e125e9a2c108f6e72ba0d4ca1bfb0b0841b497de","observation_id":"ba9c237d-58c4-43d8-a5b2-868dd2fb934b","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:efb4c424c7d096358e1bcb1dd00c6b7402ce00d713eb12282909d6bfc39e05b0","observation_id":"08cf2aab-f2b3-4e81-9178-8056e98fc953","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:e3b9e3bbc81b8e040065f0809411e4a2a0fb4acfb1d1e17316d14d8dad467d17","observation_id":"c79e9384-e9e9-428c-ac9d-26edfcdc1110","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Noise-adaptive layerwise learning rates: Accelerating geometry-aware optimization for deep neural network training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:5b0ee5c09f9e69df5ff4aa0fe945b500abb9fec9735329da5b8ce2a83a73cc56","observation_id":"4f3828e8-d530-4011-9151-3ab64144bf3d","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Ruder, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:c26339c338205b19fba4accd3da7ff6b38b1d78643cd2bf8462a3f207b2fc962","observation_id":"4db50434-f295-4ccb-9b54-85a1307e4a6c","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Muon: An optimizer for hidden layers in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:cef0db16f9e6e3479bb292b5f6bac84ae6f611ea9408db863c8a5961ad5febc5","observation_id":"06a976f0-f5bc-4e5a-83ef-8f5eb0e1c079","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:eeda588b1ec91c0aae79e1d9b1c2d578994e4396c6b025b8bd21b67363fc375c","observation_id":"8110590f-a14b-43e2-b304-8267cd8fde8c","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Cautious optimizers: Improving training with one line of code","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:2254e609fac2b5ba49f7c155b4686efa5a00cccd33a58e98252cd1112a9d74dd","observation_id":"6e190b7d-e15c-4c28-8802-d27bbc39398d","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:ef61dd453785a19a0446bcfa3a85b97dd2d3c7fc7d2eba7371641f04a6635e6a","observation_id":"03d906d2-8255-4f6f-92c7-f7c5afb7113b","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:c09883cdc33e6bec03a9925a23bf893da2b13fa3eeb1bcb84ca772cd78ec7b14","observation_id":"933195f3-a949-4f29-abd7-513c4181c0f2","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"PyTorch : An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:04493ab5948254645215de079fc053e5045bb4326631e411c6d8a20c234f0235","observation_id":"3fd542f2-6995-43d6-a295-1606c06ae251","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04358","last_updated":"2024-07-05T08:53:06Z","snapshot_observed_at":"2026-08-05T22:28:45.226571Z","submitted_at":"2024-07-05T08:53:06Z","title":"An Adaptive Stochastic Gradient Method with Non-negative Gauss-Newton Stepsizes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04358","snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Xiao, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"cited_paper":"/paper/2407.04358","citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:79dfa12d99b3925f4206c4ba0b6ef0f3af2df2faa00934a8bfbf66cb36ec9e0f","observation_id":"2f8aa75b-f52d-4c33-8878-41e9c90174c3","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"M., Schneider, F., and Hennig, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:b7479df16bd75fa41fc39e6ed0aee09e10e3898a52386b32ccf058945a58aa65","observation_id":"e959b445-3a50-4007-a07d-6cc5159f9fa0","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:e1e40964b685f663e25c1c60eca8ee6be96336cc2f9b6a6a70ec4fd863b10b01","observation_id":"2fb2fa15-5ce9-4da5-885e-850f11a83116","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"AutoDrop : Training deep learning models with automatic learning rate drop","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:b1b9e6b0750e8e2428e153b689eaab54561edc2d041f957af9ea49ce67f5319c","observation_id":"08f26162-caec-4d28-932a-a891112e0e4c","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:b119317d4a8166f46c42f3f89914f21bf1a907536fd4758ebabfcdcd5b53ae06","observation_id":"3753eee2-05cc-4415-96a8-1515526e9942","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Large batch optimization for deep learning: Training BERT in 76 minutes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:569c4bff3445fa87d6f4c013541796033e4c2538e72664e87fba0f07451343d3","observation_id":"8bff8c94-5546-4ab1-844a-34b1016ae3e4","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Komodakis, N","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:3e9447cc25e141c67e8c9120a1735c732d2c5898c2a2adf4645dfd4d92776bb8","observation_id":"d75d1813-ca1e-414e-b112-a713f5e00568","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Deconstructing what makes a good optimizer for autoregressive language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:70fbdcccb007ff9d3a2cec922dad94b2ab1558c817d9215b31e028f45935e743","observation_id":"28f9fdb4-e44b-4966-b24c-0d1186f6183a","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T21:08:27.780994Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.09266."}