{"as_of":"2026-08-08T01:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:440f53f2d4c915bbe39b79d80b09b1a38002d45954c4a7a10169b5ca159fa037","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:12.948856Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21910/citation-record","integrity":"/paper/2505.21910/integrity","json":"/paper/2505.21910/citation-record.json","paper":"/paper/2505.21910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.743495Z","title":"Rezero is all you need: Fast convergence at large depth","venue":null,"work_id":"36cd8db5-4b48-4684-bf33-fc479368b696","year":2021},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.383126Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:32fbae15e1675a432ce155e619b4b5654e1b329608c6aa1c6b29745363e6b6f9","observation_id":"257220fa-7306-4f3c-b984-ee6914197076","resolution":{"observed_at":"2026-08-07T13:26:16.871651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.480251Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.480251Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:9097416ed15938c81f67d9c38b20cc1bb2b35e065efd5b36afe201e936c0910a","observation_id":"627bff35-0fc5-4536-92e4-04b298512953","resolution":{"observed_at":"2026-08-07T13:26:05.480251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.525225Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.525225Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:56eea45ffb6b418ec4d7ac4dedc20b37eefdd1b1c7802a9466ec81d7ecf4d404","observation_id":"17532fd4-7a2f-4153-97f8-e259ec0ba405","resolution":{"observed_at":"2026-08-07T13:26:05.525225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15682","last_updated":"2024-10-29T22:40:23Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T16:20:46Z","title":"The Road Less Scheduled","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15682","snapshot_observed_at":"2026-08-07T13:26:05.649809Z","title":"The road less scheduled","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.649809Z"},"links":{"cited_paper":"/paper/2405.15682","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:0dda0110adf506f1fa2b064c0b819077b4a93a823597784076df4607d80139c1","observation_id":"42ade93d-5437-4261-bc70-9188d76b02f4","resolution":{"observed_at":"2026-08-07T13:26:05.649809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.715302Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.715302Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:19e1362abbf32cb568ad1206332fe039c6074d9bdda254a08dd707f7f5e96f15","observation_id":"f28c3483-64e4-4317-a86e-c5d6bc0d941b","resolution":{"observed_at":"2026-08-07T13:26:05.715302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.764111Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.764111Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:232a6b0c9b0c3c94e128683ae21129465b1889096d7110d9ff07fb08f6caf60e","observation_id":"e0321042-1743-4bb4-b921-325db581498a","resolution":{"observed_at":"2026-08-07T13:26:05.764111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.523162Z","title":"Attention is not all you need: Pure attention loses rank doubly exponentially with depth","venue":null,"work_id":"576f4fcd-a9f9-44d1-91c0-3e79b727936b","year":2021},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.838849Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:0fcee860bac200487138b0e32f55045d8a66c603598ac1363a5b60f0a6471e81","observation_id":"1e99ca12-4aa5-42fd-855b-6fc2a6055561","resolution":{"observed_at":"2026-08-07T13:26:16.593547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.881498Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.881498Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:ccbfa66c447e05f036d2f90fb92fc906cfda9524fb8f5801adc43e7ab69e0e55","observation_id":"7372e20c-c47f-4841-82bb-5da079e2573d","resolution":{"observed_at":"2026-08-07T13:26:05.881498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:26:05.929214Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:05.929214Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:6b44a2ff943b7aefeaf396d70f1fc5f86f9ca55297e495a36a2b3ff5a47fbaf6","observation_id":"854b518f-d178-43ed-95c7-47b460d6c760","resolution":{"observed_at":"2026-08-07T13:26:05.929214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.005636Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.005636Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:e5a1b51296796176ebb0f3955b639612462219d4c3a486723b72d04162b62636","observation_id":"2d753c21-bfb2-4229-9cd0-22251710c090","resolution":{"observed_at":"2026-08-07T13:26:06.005636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.065481Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.065481Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:1e15341a2177f74ed0255a74d160de881ce263b1df8a2a55fd34ec0c4abe1bb6","observation_id":"08543823-8ff1-4e2a-8b78-f5b61eade4d0","resolution":{"observed_at":"2026-08-07T13:26:06.065481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.120967Z","title":"Matrix computations","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.120967Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:94b6103f9f820e7ec83849119871c20a9fe1f6b54ba354aade6c7f35ceb51273","observation_id":"4272df13-9591-4304-bd64-5ceac5594f86","resolution":{"observed_at":"2026-08-07T13:26:06.120967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.345606Z","title":"Kronecker products and matrix calculus with applications","venue":null,"work_id":"dbdb9b8b-3aaf-42d6-b419-83bd05ad6c1f","year":2018},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.267817Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:d4e94f59500863dd0b278141c6bf25769301f80b10606148ceb0c74388ca43a7","observation_id":"0c820b89-57cd-4d03-bd41-95f95040d735","resolution":{"observed_at":"2026-08-07T13:26:16.410854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.143030Z","title":"Flatten transformer: Vision transformer using focused linear attention","venue":null,"work_id":"3b4c8948-b2a6-4bb8-9d54-3e034b171eac","year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.354068Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:7f78e05e9079b53287a1848919785cf5e2a7bbd120300cdf1a8b62099fc08743","observation_id":"8f33d8bf-4ad0-4313-90a8-9e874efbb050","resolution":{"observed_at":"2026-08-07T13:26:16.242762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.886417Z","title":"Query-key normalization for transformers","venue":null,"work_id":"4b5cddf7-75e2-4aa7-845d-c23c15482890","year":2020},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.453396Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:dc00e61a3d9eb468cfb3a703aad919bfa4cddaba76d85445aa7d46056f76e74d","observation_id":"0fe4f361-0ce1-4460-8fee-f92622469b58","resolution":{"observed_at":"2026-08-07T13:26:15.997633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.627175Z","title":"Topics in matrix analysis, 1991","venue":null,"work_id":"58f43542-cd96-4158-ba8f-55d003e1fb3b","year":1991},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.516079Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:1c908c61839963bd6e05e171ebd122831bdeade5c33e54b8bb41e60a97d0c57e","observation_id":"49aee7c9-c154-4248-94e0-cb2289f9f928","resolution":{"observed_at":"2026-08-07T13:26:15.735652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.586362Z","title":"Matrix analysis","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.586362Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:4c76e99f84de3c3112e0af9e8998cb5dd75fbf5984179f98e0dc675f490b0780","observation_id":"ffb6ea69-f6dd-4d8a-a5f6-2dc73da0c39e","resolution":{"observed_at":"2026-08-07T13:26:06.586362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.424725Z","title":null,"venue":null,"work_id":"52d98131-358c-4f18-a972-076301b105e7","year":2022},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.722088Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:0012e2370be0a9373ccc812911fa921cb782c82e6356875e98616842aa103322","observation_id":"f477f785-e69f-4b32-b923-bdf9488594cd","resolution":{"observed_at":"2026-08-07T13:26:15.518844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.260954Z","title":"The lipschitz constant of self-attention","venue":null,"work_id":"6d146f7c-0f15-4448-97d6-b261724d9792","year":2021},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.837314Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:11b5a4d029f16462b15b21cf95a19d930fa693ce603826d7c1c24cf5f8a7f765","observation_id":"169cfeff-2ab4-421b-a40d-5cbd51a47a97","resolution":{"observed_at":"2026-08-07T13:26:15.345563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:26:06.941052Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:06.941052Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:c93347d21fa20dba6efbbaf420609aa163085eeee285b53c7b4a89d5e0455a76","observation_id":"4d968143-41b1-4785-b4cf-c4f63278e786","resolution":{"observed_at":"2026-08-07T13:26:06.941052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17212","last_updated":"2024-06-03T15:57:47Z","snapshot_observed_at":"2026-07-06T15:34:09.163519Z","submitted_at":"2023-05-26T19:14:01Z","title":"Rotational Equilibrium: How Weight Decay Balances Learning Across Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17212","snapshot_observed_at":"2026-08-07T13:26:07.038954Z","title":"Rotational equilibrium: How weight decay balances learning across neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:07.038954Z"},"links":{"cited_paper":"/paper/2305.17212","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:425e66b36bc0b6588e0c5077e38fd3e5510562ec2436d799625ea636b68a5b57","observation_id":"cd387253-ef1e-484f-82d0-1ba700eba51c","resolution":{"observed_at":"2026-08-07T13:26:07.038954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.116790Z","title":"Analyzing & reducing the need for learning rate warmup in gpt training","venue":null,"work_id":"bc770fb0-2412-4e3f-9211-1c7be0f263e8","year":2024},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:07.233908Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:da7c55ebb9da86f9df1985bed75447a9f61f9c7f73923b476ad3e3834b3b2297","observation_id":"6944f4a5-f7d5-4d2e-bb92-c4b0edd843f4","resolution":{"observed_at":"2026-08-07T13:26:15.212279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.941710Z","title":"Backpropagation applied to handwritten zip code recognition","venue":null,"work_id":"0548a9f4-7f3d-49b0-9918-dd2b9faed2b4","year":1989},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:07.415329Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:aec461a105b9249635c42b91a9715863ac90ec9a254ed3233bc1c8e5139cfa87","observation_id":"0933c51d-06cf-4d25-ad53-f083e3f78eac","resolution":{"observed_at":"2026-08-07T13:26:14.994693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:07.676301Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:07.676301Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:fbe65fe973f001792f84c7ae733eb451195f98056159a53da1fab2b836be78ee","observation_id":"c57049ec-059f-4631-93b5-4436c488d358","resolution":{"observed_at":"2026-08-07T13:26:07.676301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.734124Z","title":"Efficient backprop","venue":null,"work_id":"a1a4ee0f-5cd2-4c54-89ce-dd7f9979f61f","year":2002},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:08.240797Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:6ec26e6a9f60326166f26c982264d356f0f92f872c06fc6b743e199ad40aef5f","observation_id":"fb3209bf-7f47-48f9-ab17-046a1f130195","resolution":{"observed_at":"2026-08-07T13:26:14.840983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.561099Z","title":"Understanding the difficulty of training transformers","venue":null,"work_id":"619079ab-b0e7-456e-b00f-1f59b2148739","year":2020},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:09.058294Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:fe38fc52291ccaf8b1c8bafd00f47594603ec842f457960fa868698a62cbfcaa","observation_id":"79db7c08-6028-4904-8bae-c0774fd91aa3","resolution":{"observed_at":"2026-08-07T13:26:14.661451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.328505Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"6f8c5f0f-362f-44f5-ab6a-bfe6ea65ecf1","year":2021},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:09.982728Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:7ddcadf41aaba9c20a396a94858b820d4abd8a0d4fb96c9bd1554828965acd3f","observation_id":"f2732e95-40cc-46f9-8159-874e53d30c51","resolution":{"observed_at":"2026-08-07T13:26:14.453992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T13:26:10.126111Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.126111Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:d9b3b3b0f9a2781006bbfb2c017403fdecd3ba3f493e5824c1d466cf23f332b5","observation_id":"cd256782-b797-43e7-9712-d932a9feac97","resolution":{"observed_at":"2026-08-07T13:26:10.126111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.132898Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":"95a10ccf-6779-4083-b545-a5a56c3c5891","year":2019},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.206724Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:801e2e02d0110faa439b9e14ca4ad0fbff44354d8dbaa6737cc4fd0df8e4c295","observation_id":"5f59261d-ae14-444f-ad00-38a8c63336dc","resolution":{"observed_at":"2026-08-07T13:26:14.237757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.967313Z","title":"Signal propagation in transformers: Theoretical perspectives and the role of rank collapse","venue":null,"work_id":"ea554a3d-6703-4bc4-af25-cc3cc3680ce4","year":2022},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.257907Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:d47a4344446b80c1f996c1bcbe0237a1c1d21efcab8802455875b95ed5a15c7f","observation_id":"dd65d404-4628-46fa-a0c1-358733015b3b","resolution":{"observed_at":"2026-08-07T13:26:14.020113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.332842Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.332842Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:36df4a0b9d6ac2e80801a2d07b4e6fba27fd924ea3120c3956a048e8e68059f6","observation_id":"598dda0a-3158-4bbf-b619-47ff234103bf","resolution":{"observed_at":"2026-08-07T13:26:10.332842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.441366Z","title":"The matrix cookbook","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.441366Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:5d92b77897533efe8d555e3bb1f2dc0a3a52e32abdc0131ae820c162374e69a7","observation_id":"f31e6bdf-8d8d-4933-90cb-1cea43146c53","resolution":{"observed_at":"2026-08-07T13:26:10.441366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.818971Z","title":"Lipsformer: Introducing lipschitz continuity to vision transformers","venue":null,"work_id":"20dc2df2-609c-4b31-801d-451342fde8a8","year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.517077Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:1b70574dc5ef32975e400d9d6d77ae426d4d374b57c91a0c11ba27e140028ed5","observation_id":"d456acfd-fcd2-4553-857e-3f24fc2b9c91","resolution":{"observed_at":"2026-08-07T13:26:13.882027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09338","last_updated":"2023-11-12T07:13:58Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:27Z","title":"Understanding Optimization of Deep Learning via Jacobian Matrix and Lipschitz Constant","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09338","snapshot_observed_at":"2026-08-07T13:26:10.591325Z","title":"Understanding optimization of deep learning via jacobian matrix and lipschitz constant","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.591325Z"},"links":{"cited_paper":"/paper/2306.09338","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:73292e42b8896a909cf6b9d1d51549b08d4a047634954a715b88b00dc9016c34","observation_id":"b97858a9-b3d1-466c-989f-5c2b8ab1aff8","resolution":{"observed_at":"2026-08-07T13:26:10.591325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.643909Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.643909Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:0c02cf195714473ff65715952b595c2e76cf6f8738fdeb12c06b54d979b44841","observation_id":"fb65b2dd-5629-4c47-bf8a-3b19f731b856","resolution":{"observed_at":"2026-08-07T13:26:10.643909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.768095Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.768095Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:a03e9366933fbe02897bc988220029ba64643aae5908d5ed3ef6e6fc397cfb69","observation_id":"fa51fde8-5b81-49ae-86f2-e89ce4479b27","resolution":{"observed_at":"2026-08-07T13:26:10.768095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.824743Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.824743Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:6f5d6d181d02fb15cab45eed45656f53fac8a7a9a245656978f280ee9dd1a666","observation_id":"023b964b-3eb8-430f-b40e-14da3b647713","resolution":{"observed_at":"2026-08-07T13:26:10.824743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.911598Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:10.911598Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:ef48be501fe344f1cb6255a087976695f5b43e3fe7c8e53e0df39582a40c8bfd","observation_id":"a7c0e253-242e-48df-aecf-9a40aa387c4f","resolution":{"observed_at":"2026-08-07T13:26:10.911598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.015079Z","title":"A stochastic approximation method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.015079Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:9d557263bde05027557a98fe555730e5dd70bdd76d11058ceca3e0134cd3bd3d","observation_id":"7f679c03-3b1a-42c7-850d-ed29c4038639","resolution":{"observed_at":"2026-08-07T13:26:11.015079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.102419Z","title":"Learning representations by back-propagating errors","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.102419Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:a301053a903f8d9ced87f30c8b4a34d618a67d661dd777b52283f8cf1b5da951","observation_id":"1e3f62cb-71d6-4f6f-a084-f403cb1c1f0d","resolution":{"observed_at":"2026-08-07T13:26:11.102419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.559296Z","title":"Cyclical learning rates for training neural networks","venue":null,"work_id":"5e717ea8-a67a-4d9f-ba0c-b8d18c15ff9f","year":2017},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.173579Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:0f5e97e41ed258c51cfd84afb29198111dec2a48699c6a176dfd619997392d32","observation_id":"16719b8a-8d27-4e6f-8747-3abe37ca8fdc","resolution":{"observed_at":"2026-08-07T13:26:13.656492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.393718Z","title":"Scan and snap: Understanding training dynamics and token composition in 1-layer transformer","venue":null,"work_id":"4b64ebd3-cb20-4246-89df-0a907d179e9b","year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.280585Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:aa760d86f08cae95719d00e0002ae54a189f8e114789d8f6a0d409c520e93386","observation_id":"9c2748a7-0246-48b5-81c1-211a72517b3a","resolution":{"observed_at":"2026-08-07T13:26:13.453488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00535","last_updated":"2024-03-15T02:03:21Z","snapshot_observed_at":"2026-08-06T09:09:36.400979Z","submitted_at":"2023-10-01T01:21:35Z","title":"JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00535","snapshot_observed_at":"2026-08-07T13:26:11.405603Z","title":"Joma: Demystifying multilayer transformers via joint dynamics of mlp and attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.405603Z"},"links":{"cited_paper":"/paper/2310.00535","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:cbde3ec1d6447ea3e307b39fb1636215e6cf2b823f54ef7765f4c9f55b162a09","observation_id":"795361a3-6a79-46e7-ab88-0175b600b518","resolution":{"observed_at":"2026-08-07T13:26:11.405603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:26:11.518646Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.518646Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:82ecb0429269749e22525c1f33952d8d923e7ebd7e1a65eb1f160f181be6f646","observation_id":"ffe7fa62-6a19-4c8a-bdf5-0d1005c938a4","resolution":{"observed_at":"2026-08-07T13:26:11.518646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.617287Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.617287Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:db31ed76b684d46a45dd49683abafe10113c84ec057125431329d97342dec094","observation_id":"15ca0245-aad0-4545-a921-8d27e25009d2","resolution":{"observed_at":"2026-08-07T13:26:11.617287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.746254Z","title":"High-dimensional probability: An introduction with applications in data science, volume 47","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.746254Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:af7f588c69d6bc0d84f760e665f0c6f40ccf5d1daba7269feff053f6188659ed","observation_id":"61e6a18f-7c0a-40fe-9936-df9204792b23","resolution":{"observed_at":"2026-08-07T13:26:11.746254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-07T13:26:11.857239Z","title":"Deepnet: Scaling transformers to 1,000 layers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.857239Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:b4878df9f83da2b3fd66ff34cffcb09fc1b3682dfe4a4950e8d6357c76e6ce8b","observation_id":"c5041f34-d033-4787-b3bf-16da13f0a5b6","resolution":{"observed_at":"2026-08-07T13:26:11.857239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01787","last_updated":"2019-06-05T02:24:12Z","snapshot_observed_at":"2026-08-03T07:18:32.451630Z","submitted_at":"2019-06-05T02:24:12Z","title":"Learning Deep Transformer Models for Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01787","snapshot_observed_at":"2026-08-07T13:26:11.909056Z","title":"Learning deep transformer models for machine translation","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.909056Z"},"links":{"cited_paper":"/paper/1906.01787","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:7f30e47592fb5922f3f7a361dc30be74cc6d533aa929d991f5f64c26c3380d85","observation_id":"81f2774c-3042-4510-900d-333208208d21","resolution":{"observed_at":"2026-08-07T13:26:11.909056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.056554Z","title":"Pytorch image models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.056554Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:5e87c0eb39ccee3d46170e951f0cdfd274630dae73a95151c8765824c2111c5c","observation_id":"a3150a55-86c8-429c-8061-24f545beced3","resolution":{"observed_at":"2026-08-07T13:26:12.056554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.154560Z","title":"High-dimensional data analysis with low-dimensional models: Principles, computation, and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.154560Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:62e27491b39d47b7f7fcb6c73808865e86fa50644ad5f6a0a9658518bd9831f9","observation_id":"46f3d844-ff54-4cfb-bdc5-1da34e717569","resolution":{"observed_at":"2026-08-07T13:26:12.154560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.168356Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":"d0ba340a-8b1d-41bc-a4a8-cbbe656a4b42","year":2020},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.285606Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:bff007810ee4a334a0294725729b83b22598f59f188301c3f2fb7d4b7c353d4f","observation_id":"7a1d6b40-b659-4b7d-858c-64b2334feedc","resolution":{"observed_at":"2026-08-07T13:26:13.239775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.409813Z","title":"Stabilizing transformer training by preventing attention entropy collapse","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.409813Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:dfe08a312f2dbaedf5a75cd2df1850c5d17247db1e2f64449bf2db0bb7c9ecf2","observation_id":"10660810-ac57-42c8-835a-697d9671cbea","resolution":{"observed_at":"2026-08-07T13:26:12.409813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.544561Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.544561Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:005685498ff4f02fe1b225ece644f952e7b398e2fc2982cbd41f370de6ded305","observation_id":"cc1460b6-f112-4c9c-b2ed-ea07f901c0d4","resolution":{"observed_at":"2026-08-07T13:26:12.544561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.625867Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.625867Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:a8797f26f60fb4529efbd992542ddaa61ba8ebdf7f23a3e988f47f41681dce6f","observation_id":"42508aa3-13a1-450e-8e89-2b0aae900f3f","resolution":{"observed_at":"2026-08-07T13:26:12.625867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.700048Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.700048Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:420cea9e9553f89c9f7c38e0d486f1dacca15ac420c01d949603e6fd8d29aaef","observation_id":"0a02c986-71ee-4c54-8c00-217fe0d1b11c","resolution":{"observed_at":"2026-08-07T13:26:12.700048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.817304Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.817304Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:e43fd9820b152a5181e7158b190d2284a761197812c253c01ca124b876a86eea","observation_id":"55fd245d-a651-4a37-866a-fd997f6cb4e7","resolution":{"observed_at":"2026-08-07T13:26:12.817304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.948856Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:12.948856Z"},"links":{"citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:ec9b1168192f8437f31188d04121a5dbaa0a051a42f6138cf4e42996da2b10cc","observation_id":"5978d486-dbf6-47f8-a283-ca2b4fba5aaf","resolution":{"observed_at":"2026-08-07T13:26:12.948856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2505.21910."}