{"as_of":"2026-08-15T20:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d20c75021cd1687b36e1a65f343883e36e9a5cd5fdc98bd4cccf2620ff8a34c","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:54:42.614806Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T17:31:32.533941Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:34:57.593618Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"cited_work":{"arxiv_id":"2506.15025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15025","snapshot_observed_at":"2026-06-30T17:34:57.593618Z","title":"and Liu, L","venue":null,"work_id":"0c9aed32-c6c5-4249-a693-b94ad28fb680","year":null},"citing_paper":{"arxiv_id":"2605.21486","last_updated":"2026-05-20T17:59:40Z","snapshot_observed_at":"2026-08-14T09:06:52.127366Z","submitted_at":"2026-05-20T17:59:40Z","title":"Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T05:01:27.451161Z"},"links":{"cited_paper":"/paper/2506.15025","citing_paper":"/paper/2605.21486"},"observation_digest":"sha256:cf48ac7607b75cd8de1a100c3cde4a245d7c523576de3519ef0f31bebe91775d","observation_id":"b12fee4f-c0fe-4629-9cfd-5c377a29cff1","resolution":{"observed_at":"2026-05-21T05:03:57.956920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"cited_work":{"arxiv_id":"2506.15025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15025","snapshot_observed_at":"2026-06-30T17:34:57.593618Z","title":"and Liu, L","venue":null,"work_id":"0c9aed32-c6c5-4249-a693-b94ad28fb680","year":null},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T07:44:16.677054Z"},"links":{"cited_paper":"/paper/2506.15025","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:3cce61327fd98813caf5a04a498c91a33cd352cc51fc0833088a5f28b70fdc1b","observation_id":"00fd0d3b-1820-4c62-ad19-72b38dc51853","resolution":{"observed_at":"2026-05-22T07:44:42.593237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"cited_work":{"arxiv_id":"2506.15025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15025","snapshot_observed_at":"2026-06-30T17:34:57.593618Z","title":"and Liu, L","venue":null,"work_id":"0c9aed32-c6c5-4249-a693-b94ad28fb680","year":null},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-15T05:19:29.806486Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2506.15025","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:73e4b82adce915b145bc5f9f8ce6c641b9b0643e5b0baba5d13545a5aa5ba683","observation_id":"bc462715-4679-4150-bef0-3cee690c782f","resolution":{"observed_at":"2026-06-30T17:34:57.595450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15025/citation-record","integrity":"/paper/2506.15025/integrity","json":"/paper/2506.15025/citation-record.json","paper":"/paper/2506.15025"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17465","last_updated":"2025-01-10T14:22:02Z","snapshot_observed_at":"2026-08-12T23:15:26.466256Z","submitted_at":"2024-07-24T17:58:42Z","title":"u-$\\mu$P: The Unit-Scaled Maximal Update Parametrization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17465","snapshot_observed_at":"2026-08-15T19:54:42.444889Z","title":"Prince, Bj ¨orn Deiseroth, Andres Felipe Cruz-Salinas, Carlo Luschi, Samuel Weinbach, and Douglas Orr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.444889Z"},"links":{"cited_paper":"/paper/2407.17465","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:093c59140215a6bc92c6a3bea85777d49c1ea0fc5f281f95a4b094117c3ddc8f","observation_id":"b3f8b846-6e14-4517-be05-f687fba975d8","resolution":{"observed_at":"2026-08-15T19:54:42.444889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16620","last_updated":"2023-12-08T18:19:44Z","snapshot_observed_at":"2026-08-15T13:30:21.891705Z","submitted_at":"2023-09-28T17:20:50Z","title":"Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16620","snapshot_observed_at":"2026-08-15T19:54:42.450340Z","title":"Depthwise hyperparameter transfer in residual networks: Dynamics and scaling limit, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.450340Z"},"links":{"cited_paper":"/paper/2309.16620","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:a1425bb12faf00e7976768e6b95af040aa59bae7a069a252041b759cef6537de","observation_id":"b4fc21cb-ea38-4af4-afab-63a2f63c7b5e","resolution":{"observed_at":"2026-08-15T19:54:42.450340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07956","last_updated":"2020-01-07T16:11:56Z","snapshot_observed_at":"2026-08-14T17:41:13.899637Z","submitted_at":"2018-12-19T14:11:20Z","title":"On Lazy Training in Differentiable Programming","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07956","snapshot_observed_at":"2026-08-15T19:54:42.454722Z","title":"On lazy training in differentiable programming, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.454722Z"},"links":{"cited_paper":"/paper/1812.07956","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:022a0453d65255b2af16107a6186b9ad6cf10215efeca38fe3b6cbcfdb30ac2e","observation_id":"4e9517dd-5fdd-4a8e-91e5-5d50efc79d17","resolution":{"observed_at":"2026-08-15T19:54:42.454722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.459894Z","title":"Infinite- width limit of deep linear neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.459894Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:8fa4fc067279d6e09ac10d6f1191383b4876192f3a3f12989ee6088fc77a9718","observation_id":"2e495ec2-61aa-4a99-b5c0-c7a317109251","resolution":{"observed_at":"2026-08-15T19:54:42.459894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.125309Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":"a60a6dd4-d7cd-4bb9-83e2-acbeaad5a1a8","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.464142Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:e920f2f9383f1a99f9c32a1324fe4cf20a3c4431e5922bc0b7323e5ee85e25e6","observation_id":"52002095-c746-4854-844c-d90658e74767","resolution":{"observed_at":"2026-08-15T19:54:43.129312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.111418Z","title":"On the infinite-depth limit of finite-width neural networks","venue":null,"work_id":"b320c90a-964e-4a44-a688-37b3e39e6748","year":2022},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.473690Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:0c04c99dc6b93fc0447a348c4e0d8029954ff3c8a2d0ca2e8fc36233759a0d65","observation_id":"82f197d9-4eb3-444a-83c2-647fe2f7f6c1","resolution":{"observed_at":"2026-08-15T19:54:43.115696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.097279Z","title":"On the impact of the ac- tivation function on deep neural networks training","venue":null,"work_id":"f2e2bb8a-dcca-4433-bbb8-4e0b4b4841a3","year":2019},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.477648Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:e9eb661d6df34d0e99d5090edf16e71b21be3619d4116a2c88151e10eeb7138b","observation_id":"87e1e4de-8cd6-4997-a736-fe3820039dec","resolution":{"observed_at":"2026-08-15T19:54:43.102018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.082780Z","title":"Stable resnet","venue":null,"work_id":"cd1eb10c-715c-4960-bb13-7a5f98fe12be","year":2021},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.482191Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:19e679a957cddbb9c7fc941f0f12c70c112eb3576f743dc48218dada2cc076cd","observation_id":"2f285087-ba6c-4b17-946f-12894b8c479c","resolution":{"observed_at":"2026-08-15T19:54:43.087750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.01852","last_updated":"2015-02-06T10:44:00Z","snapshot_observed_at":"2026-08-14T23:01:07.044616Z","submitted_at":"2015-02-06T10:44:00Z","title":"Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.01852","snapshot_observed_at":"2026-08-15T19:54:42.485996Z","title":"Delving deep into rec- tifiers: Surpassing human-level performance on imagenet classification, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.485996Z"},"links":{"cited_paper":"/paper/1502.01852","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:a335b0469e5800a6aa7dc9b8ced7e8e590bef4d219ee49f70b30207d04fcfbf9","observation_id":"b5cf8226-42e4-4f65-8ba2-6adf96c288c4","resolution":{"observed_at":"2026-08-15T19:54:42.485996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07572","last_updated":"2020-02-10T08:39:09Z","snapshot_observed_at":"2026-08-14T19:01:37.246770Z","submitted_at":"2018-06-20T06:35:46Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07572","snapshot_observed_at":"2026-08-15T19:54:42.490672Z","title":"Neural tangent kernel: Conver- gence and generalization in neural networks, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.490672Z"},"links":{"cited_paper":"/paper/1806.07572","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:ce911247ef4fdfd062bb08aef989e1affc5e98f634ef34d12f305b094d25988c","observation_id":"fd4661cb-4347-492a-aca5-915c0d87ec2a","resolution":{"observed_at":"2026-08-15T19:54:42.490672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.065583Z","title":"Muon: An optimizer for hidden layers in neural networks,","venue":null,"work_id":"8b4a61e3-a2f5-4692-a5d3-b12ebc56bccc","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.495390Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:744bde1b80605cb80943249bfd0e1d2536967c7634d2ff7bacde580d72614cd6","observation_id":"590b4620-eaa3-47ac-be14-15a5c3c5747e","resolution":{"observed_at":"2026-08-15T19:54:43.070446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.503330Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.503330Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:8c1139ea6a2fcbf92e2e5f19bcd0ee1d1fb11c6077a567c94a5546b8194447a0","observation_id":"0f979c3d-4478-4ecb-953e-6ca8318b1ec3","resolution":{"observed_at":"2026-08-15T19:54:42.503330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.052387Z","title":null,"venue":null,"work_id":"3cfd8d9b-d42b-4386-8678-7207e5a9f7f1","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.499441Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:cd0ae6272bbb6f0fc2b266fbe989c7171982d89d80b1cfbe2b8f7f0990330852","observation_id":"d8abe900-b9de-495f-bf1e-7662454d1e7f","resolution":{"observed_at":"2026-08-15T19:54:43.056873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.516190Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.516190Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:fcf588ab4c7e781da7354662d3692ff3928e22e5e782c6e67a3e5fa006d8255f","observation_id":"3075e622-a266-4e46-b146-b163ba8bfff7","resolution":{"observed_at":"2026-08-15T19:54:42.516190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.023657Z","title":"Pointer sen- tinel mixture models, 2016","venue":null,"work_id":"d34c3a9c-60ff-4fc1-bbc5-cd7fc9a6510e","year":2016},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.521875Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:c6d794066de633f1114c43456cdc10e415623e80007400976d2e506cbf177186","observation_id":"230ffc16-b8eb-421f-8d85-49e6a96e7ec7","resolution":{"observed_at":"2026-08-15T19:54:43.028154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05728","last_updated":"2025-02-13T23:19:42Z","snapshot_observed_at":"2026-08-14T18:26:29.137477Z","submitted_at":"2024-04-08T17:59:44Z","title":"An Empirical Study of $\\mu$P Learning Rate Transfer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05728","snapshot_observed_at":"2026-08-15T19:54:42.511780Z","title":"An empirical study of µp learning rate transfer, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.511780Z"},"links":{"cited_paper":"/paper/2404.05728","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:fb1121e828391ecabebc0d58cebf2d737b41ba1006c581e65bf5322618e6e598","observation_id":"4976277b-3b6d-46c9-ada3-c88d92d87a5f","resolution":{"observed_at":"2026-08-15T19:54:42.511780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.011231Z","title":"Poole, S","venue":null,"work_id":"ee91bd4c-2c32-4129-b129-ee6207722fb2","year":2016},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.530857Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:8d43dee3ba430c52a533de5f864c30b4adb08f6a4897f9fe07bde17bfccadefd","observation_id":"a6df0e87-6b3a-459e-9930-6d91c199d3ae","resolution":{"observed_at":"2026-08-15T19:54:43.015329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.997361Z","title":"Schoenholz, J","venue":null,"work_id":"1b602377-d04c-4460-a2b1-15479b926aad","year":2017},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.535008Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:049a848fd3fa8998e58d60aa75b2cbb40c6955a1eb7da85374913b7725cbf91d","observation_id":"07b7ee97-7df3-4b56-9441-1ac76142e1c4","resolution":{"observed_at":"2026-08-15T19:54:43.001690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.526095Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.526095Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:753f7ef6e0fb0a7a9234bdb1767d519844843de6c99788893acf5f145fc543c7","observation_id":"19eda179-91e6-419b-b004-cbde3f0c47a5","resolution":{"observed_at":"2026-08-15T19:54:42.526095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-15T19:54:42.544080Z","title":"The falcon series of open language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.544080Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:761717476ba4a09a56072ac765d75f73ae192f559b5bac468dfa1f37a389e893","observation_id":"60dcbd05-82f5-42d8-827a-7668986fbb75","resolution":{"observed_at":"2026-08-15T19:54:42.544080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.548770Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.548770Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:62286f2e8467bd2ce532377d3801c4aebbdf87785864edd256b4236023ef6070","observation_id":"2d3fc3b8-693c-4e3e-9bc2-7b06c8d81e88","resolution":{"observed_at":"2026-08-15T19:54:42.548770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13623","last_updated":"2024-11-01T02:41:36Z","snapshot_observed_at":"2026-08-15T01:58:55.775502Z","submitted_at":"2024-07-18T15:58:54Z","title":"Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13623","snapshot_observed_at":"2026-08-15T19:54:42.539112Z","title":"Scaling laws with vocabulary: Larger models deserve larger vocabularies, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.539112Z"},"links":{"cited_paper":"/paper/2407.13623","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:1f077d648e26dd79c88ad446a0bd17ca7478d4079a39976e7fa37eb7cac2a1fd","observation_id":"f736ab14-e453-4cf0-811d-2a28c79e8fe8","resolution":{"observed_at":"2026-08-15T19:54:42.539112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04760","last_updated":"2020-04-04T22:53:19Z","snapshot_observed_at":"2026-08-14T17:17:07.234917Z","submitted_at":"2019-02-13T06:09:18Z","title":"Scaling Limits of Wide Neural Networks with Weight Sharing: Gaussian Process Behavior, Gradient Independence, and Neural Tangent Kernel Derivation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04760","snapshot_observed_at":"2026-08-15T19:54:42.557483Z","title":null,"venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.557483Z"},"links":{"cited_paper":"/paper/1902.04760","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:5671fdb82fd62145a32372ca6f986f0d841e20c5f7c89d7ff6400476f874dfd3","observation_id":"ea63cfd8-d429-48e1-af50-f8099316e3ec","resolution":{"observed_at":"2026-08-15T19:54:42.557483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-13T23:41:36.523890Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-15T19:54:42.562346Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer.arXiv preprint arXiv:2203.03466, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.562346Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:9fe57535b9c0fcab10328ba84c4265132c21ee2a2743266b4da45a1e833a2e37","observation_id":"9469a6ce-f8dc-40e0-b5ca-7656daaba731","resolution":{"observed_at":"2026-08-15T19:54:42.562346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T19:54:42.552969Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.552969Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:f3f56fcb5918c7f40f47c771f3b10e3f5f1b4f0cc33e99edd7cfd09b4a814725","observation_id":"ec43db71-939e-494a-b99c-f35d63d9c7a3","resolution":{"observed_at":"2026-08-15T19:54:42.552969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.977782Z","title":"How does critical batch size scale in pre-training?,","venue":null,"work_id":"b2984cfe-92ff-4c83-ac46-5cc92fcdc670","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.571451Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:2525e7cbac27a2773a2f49b4e1cd48e8966115f62f8a21ece7ed4b22664107b7","observation_id":"1d57d817-22eb-4cb8-a62c-a0f2eb0de283","resolution":{"observed_at":"2026-08-15T19:54:42.981917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.965370Z","title":"Selected Studies of the Principle of Relative Frequency in Language","venue":null,"work_id":"0cd45cff-0f73-42f7-91f7-dd9896f69e05","year":1932},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.579612Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:04ab641ecdde58dc94efef0fe113821ab138ac9e3b4f80ef114b7bc835660749","observation_id":"23af0345-ba61-4677-a09e-a194ec2b363b","resolution":{"observed_at":"2026-08-15T19:54:42.969342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02244","last_updated":"2023-10-12T17:50:31Z","snapshot_observed_at":"2026-08-13T05:58:12.822206Z","submitted_at":"2023-10-03T17:50:40Z","title":"Tensor Programs VI: Feature Learning in Infinite-Depth Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02244","snapshot_observed_at":"2026-08-15T19:54:42.567261Z","title":"Tensor programs vi: Fea- ture learning in infinite-depth neural networks, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.567261Z"},"links":{"cited_paper":"/paper/2310.02244","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:5b108bc9e066ba3f2bdc23c4028d85df965f852e7906880c5fe8b6ead669d224","observation_id":"301056cd-5a09-4409-b131-1c21484cc905","resolution":{"observed_at":"2026-08-15T19:54:42.567261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.952467Z","title":"Because Wj∼N (0,Im) and Mj =⟨v,Wj⟩, for anyi∈ [m] the pair (Mj,Wji) is jointly Gaussian with correlationρ := vi ∥v∥","venue":null,"work_id":"7218c2bc-7a4d-472e-962c-9c3bae3d4b88","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.585134Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:1c94e296613744c8537f4b5d4ada146c5985d727ea8d918c33638f0ad3915200","observation_id":"69665084-8ddd-457a-aa2c-ee73b03ebf63","resolution":{"observed_at":"2026-08-15T19:54:42.956995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.938881Z","title":"Still conditional on v, sign(Mj) is±1 with equal probability, independent of the magnitude of Wj","venue":null,"work_id":"262c8112-849a-46ab-adb1-420b3acfaba9","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.590226Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:9e17180e7000d918e16fb82c34db1e183d5398a97dd7cd58af573bbbd796992e","observation_id":"f171a23a-e471-4f34-8e9d-ba48be49c6c9","resolution":{"observed_at":"2026-08-15T19:54:42.943251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.926245Z","title":"Because the Yj’s are conditionally independent, Ev Cov(X|v) = Ev h dX j=1 Cov(Yj|v) i =d Im− Ev µ(v)µ(v)⊤ | {z } = 2 πmIm = d− 2d πm Im","venue":null,"work_id":"c5c00804-939f-449a-bf5d-18bbbfa91790","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.597097Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:5b1d35d15381ef56dbd3cf3bb686a749c69f45ed740de2554e849a38f0f5d147","observation_id":"a4358c98-7dd9-49d2-b588-4b01e82d6cf0","resolution":{"observed_at":"2026-08-15T19:54:42.930270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.913532Z","title":"From Step1, E[X|v] =dµ (v), so Covv E[X|v] =d2 Covv µ(v) =d2 2 π Covv v ∥v∥ = 2d2 πmIm","venue":null,"work_id":"41a4b011-67d8-4c84-9828-d429de44d968","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.601434Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:7d52c75a66116448fa9d4a0eb129bc862f9686270af5b81436f7419c98fba6a8","observation_id":"31f911b0-7376-4e10-a45a-49d7fdd94672","resolution":{"observed_at":"2026-08-15T19:54:42.917670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.899105Z","title":"Conditioning on E, each entry of E⊤M a centered Gaussian variable, hence E[S(E⊤M)|E] = 0","venue":null,"work_id":"bd960df6-193c-4a56-a72a-3aaa845bd0aa","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.606351Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:2bbe55d882e7574d694dc30e3833477b7d7978806ef81c179cf912c8cc66cfc6","observation_id":"99f7d6eb-a9a8-4b1c-8f78-015dd947a521","resolution":{"observed_at":"2026-08-15T19:54:42.903671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.881893Z","title":"Fix a column index k","venue":null,"work_id":"f1a03e30-28e2-4be1-aac3-ab0a73d8aa63","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.610552Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:7c139a51bcc694d34313f94d776005f437aaaf1bc51c1cf81bd599f3aee027c9","observation_id":"e1760d3f-2b56-4eaa-be4c-e3aca666982c","resolution":{"observed_at":"2026-08-15T19:54:42.888341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.864908Z","title":"Different columns ofM (differentk) are independent, so Cov(X) is diagonal and each coordinate variance is the same as above","venue":null,"work_id":"bf1d1278-4ce4-4f9a-b9ba-99f97d0f2100","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.614806Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:83b32dcec3e9361a0d7d34fe8239f2864a7c31bb015146a33691fb5c21d024d4","observation_id":"ef577664-d8da-4277-9f3e-194bb3efff91","resolution":{"observed_at":"2026-08-15T19:54:42.871604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T19:54:42.507645Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.507645Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:69a2dcde633301c8cbb66295ecdb38da98bb3fa02c29cb4ee64b43dd08001810","observation_id":"52994ea5-ed58-4778-9f43-0c7fd4e17cd0","resolution":{"observed_at":"2026-08-15T19:54:42.507645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-12T23:26:49.280247Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-15T19:54:42.469149Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.469149Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:690a8f49d0c12485025b04a348450924eec9e1dc9caaea4ef4ab2cf8d3f56ccc","observation_id":"3c8dd48f-a720-4c59-839c-43c18097175c","resolution":{"observed_at":"2026-08-15T19:54:42.469149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-08-14T23:56:27.148203Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-15T19:54:42.575268Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.575268Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:9fd672fe81497290d9985b18c0221f43cb159e682c54a0484b0cef5e2ec46544","observation_id":"08d43654-9d72-4310-8e60-28d09a1f0868","resolution":{"observed_at":"2026-08-15T19:54:42.575268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T19:43:21.687596Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 3 inbound Pith citation observations for arXiv:2506.15025."}