{"as_of":"2026-08-09T18:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a83920104e24a300952c5bef3c4187e490ff87d2d98519099f33b8fa8ce3ee3b","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:54:58.891090Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.17501/citation-record","integrity":"/paper/2507.17501/integrity","json":"/paper/2507.17501/citation-record.json","paper":"/paper/2507.17501"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T14:54:58.796795Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.796795Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:43795ce9e63accf4019d09ae8618a87875208de5c67cb01405669a06a279ceb7","observation_id":"ce36854f-edba-4a91-9615-b9841d518ab7","resolution":{"observed_at":"2026-08-06T14:54:58.796795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T14:54:58.818406Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.818406Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:a62b05d40e6a67faa62c146fd4e073b6a3df91ac70649887c109fbc8056d6b05","observation_id":"d219215c-3b81-437b-81be-c36abb8427cd","resolution":{"observed_at":"2026-08-06T14:54:58.818406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T14:54:58.823828Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.823828Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:cc3ba518acfb0c78325291b4a1edd144a1786f75641432a1fea31321302c3db9","observation_id":"05b68beb-efea-4b68-b80d-19d4b1057d2d","resolution":{"observed_at":"2026-08-06T14:54:58.823828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14458","last_updated":"2025-01-24T12:42:38Z","snapshot_observed_at":"2026-07-06T20:25:31.304367Z","submitted_at":"2025-01-24T12:42:38Z","title":"A Survey of Optimization Methods for Training DL Models: Theoretical Perspective on Convergence and Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14458","snapshot_observed_at":"2026-08-06T14:54:58.844812Z","title":"A survey of optimization methods for training dl models: Theoretical perspective on convergence and generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.844812Z"},"links":{"cited_paper":"/paper/2501.14458","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:e081716373ef3b49abb655c3b6361d9eabb8c0681a95b7fcdd542333a1175174","observation_id":"fc2c3735-121c-44aa-80ff-0ef1832a9784","resolution":{"observed_at":"2026-08-06T14:54:58.844812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-06T14:54:58.851371Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.851371Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:2d932aeba33b666508839f2ef1f9750bc255e47a2dee17ca491759e502205918","observation_id":"c3f65aae-289e-4c31-be1a-4d27a400a888","resolution":{"observed_at":"2026-08-06T14:54:58.851371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10622","last_updated":"2025-06-14T08:10:48Z","snapshot_observed_at":"2026-08-07T22:20:27.338782Z","submitted_at":"2025-03-13T17:59:06Z","title":"Transformers without Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10622","snapshot_observed_at":"2026-08-06T14:54:58.862382Z","title":"Transformers without normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.862382Z"},"links":{"cited_paper":"/paper/2503.10622","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:50ba15e9d4b12cb1bab1e5c0d72d2ec31a3cae8b2b4bc931d8201e2b0cab74d0","observation_id":"a4a68fd6-09ed-4b1f-b3d8-372136ec03ff","resolution":{"observed_at":"2026-08-06T14:54:58.862382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:54:59.228187Z","title":"In a backpropagation, since we have obtained ∂L ∂vec(Y ), we would like to further analyze ∂L ∂vec(Wq) , ∂L ∂vec(Wk) , ∂L ∂vec(Wv)","venue":null,"work_id":"3e5518b5-d4ba-44e5-9a31-baa1ae241838","year":2012},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.868032Z"},"links":{"citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:a33e8df76a61bdf9f1aad10f7ee96392789af31e9ba2225dbd1d8b40427462bc","observation_id":"ca7a4ae5-d782-4073-8b6c-93d8e67b6134","resolution":{"observed_at":"2026-08-06T14:54:59.233831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:54:59.154141Z","title":"Défossez et al","venue":null,"work_id":"0590b575-e316-4b4d-be7b-2f4638810cff","year":2025},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.891090Z"},"links":{"citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:96f4b14e4553be6e6fc5b1f3e70eb0074b1bc6d1fde67654047b1f663b5e7e43","observation_id":"55947400-400a-4948-8d24-66b547135587","resolution":{"observed_at":"2026-08-06T14:54:59.160647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:54:59.173106Z","title":"This method augments the gradient direction with a fraction of the update vector from the previous step, allowing faster convergence and helping escape local minima","venue":null,"work_id":"e9202aee-4bf8-43c0-a5cc-b1320c411324","year":2018},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.884769Z"},"links":{"citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:8adcbfead07eca1988089c0a8be28419c03909c897b49f71184b7a1d14bd9b45","observation_id":"38da0786-31b5-44cb-a816-8b63bc9fd89e","resolution":{"observed_at":"2026-08-06T14:54:59.180836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T14:54:58.834431Z","title":"Qwen technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.834431Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:f4501c40c16d07c7626aea646769051ecf84ca123693006bb90b173d7982584e","observation_id":"e20bf3e9-e019-4bb4-8551-e98612ef886b","resolution":{"observed_at":"2026-08-06T14:54:58.834431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-06T14:54:58.857286Z","title":"Mars: Unleashing the power of variance reduction for training large models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.857286Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:d438d9de111a41d5cd4ab4c140402f338d09a51842f00979362807a035851423","observation_id":"a11c4c39-2f8d-4a92-a779-1caf95de60bb","resolution":{"observed_at":"2026-08-06T14:54:58.857286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:54:58.802656Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.802656Z"},"links":{"citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:1fda68d84da3709037a4007a8b45342ad94541909453fa7a412d4e2382985056","observation_id":"e4d077cf-903a-497f-9a1a-68817dae4d15","resolution":{"observed_at":"2026-08-06T14:54:58.802656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:54:59.208707Z","title":"All language models were trained on OpenWebText, using GPT-2 tokenizer","venue":null,"work_id":"068448fd-783c-4887-a976-55a3d7fe8174","year":2000},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.873604Z"},"links":{"citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:62b6ec8582d1c908d22d526959d56c0312d42e399c0e52a0802272cf04f255a7","observation_id":"bfe13c81-6ebe-4925-ab8b-32859137c785","resolution":{"observed_at":"2026-08-06T14:54:59.215255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T14:54:58.808030Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.808030Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:3c672d9e853a4cb8f2fc170f8b7cab631920c788a8a1c56af069a91221dd5f31","observation_id":"c3ff864a-a53e-40a7-ae5c-7b7fbb974fe1","resolution":{"observed_at":"2026-08-06T14:54:58.808030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:54:59.247453Z","title":"Query-key normalization for transformers","venue":null,"work_id":"5177ec2d-90ec-4fac-9c6f-9a17e3d4ee41","year":2020},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.812922Z"},"links":{"citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:ce3500442560de1b8b0086f1218500565a764d19a4828164085a8a8ba389f69a","observation_id":"271477db-e557-4ed9-9925-3ced02bd0778","resolution":{"observed_at":"2026-08-06T14:54:59.253015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T14:54:58.840074Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.840074Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:4efdfafa91b9825df79eb234be9df6ca0faf4029c56f325c325e29b83b818047","observation_id":"2937fc9b-9bca-464a-9646-ea17b6a75406","resolution":{"observed_at":"2026-08-06T14:54:58.840074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-08T09:25:28.224090Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-06T14:54:58.829273Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.829273Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:380a4a718d9a7d356acb217a27bf9cfb58f995dc2434cbbaad34fb18c3669f1d","observation_id":"8ff146d4-94b4-4b36-9368-70d78bbf45b9","resolution":{"observed_at":"2026-08-06T14:54:58.829273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:54:59.192702Z","title":null,"venue":null,"work_id":"52d8509b-18c7-4331-a165-5aeec6ddec00","year":2000},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2242,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.879365Z"},"links":{"citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:89eaca06af60ff8bdc8697db94dc8ea205967356fc24a7ff07f82081cbec2722","observation_id":"a612d0c9-61dc-4944-b71d-eba64cdf5b11","resolution":{"observed_at":"2026-08-06T14:54:59.197679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:54:02.080899Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2507.17501."}