{"as_of":"2026-08-08T05:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1530a15948921d40482bb3175030923a6188ebc62eecb81c9cfb1c21c24c346","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:21:11.749664Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22049/citation-record","integrity":"/paper/2506.22049/integrity","json":"/paper/2506.22049/citation-record.json","paper":"/paper/2506.22049"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:14.764887Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"736ee709-39ab-4f99-aa6a-1ddf3e859097","year":2017},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.405154Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:0cb9538fd1644ed4379603ae29f4ef848cc3c94d90134ccc417ed9feccf963f8","observation_id":"a1e56cb1-b782-4045-8322-3306d5d4fc46","resolution":{"observed_at":"2026-08-06T22:21:14.855557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:21:09.452244Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.452244Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:0d42eb3b43bc4b647b9433544f9d37ae548ff4c686d77e5cc16a57b138316d49","observation_id":"f6ae2540-0da1-4afd-8286-7f3a109c9cc2","resolution":{"observed_at":"2026-08-06T22:21:09.452244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T22:21:09.516987Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.516987Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:8e112e116568511e6a6249f43dd23ed116b80418c5c2f22db450341817c2d2a3","observation_id":"0bd11535-26f4-403f-a4b6-860fed6d6cc7","resolution":{"observed_at":"2026-08-06T22:21:09.516987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:21:09.605367Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.605367Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:aaeb68c74fef3d98712e770136ebdc53fde5a41a867562e79f27a8ca04b9fd19","observation_id":"b4bb5521-5c02-4c3a-b75c-b1b989834350","resolution":{"observed_at":"2026-08-06T22:21:09.605367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:14.615699Z","title":"Adaptive input representations for neural language modeling","venue":null,"work_id":"c8784fc1-c571-4e95-8e65-e12abc563f31","year":2019},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.660591Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:c06e317a6f61d35908b2a23870e5d3657a7fa41de52401da817885f19c9552d7","observation_id":"caca3065-fec6-45b6-a839-e549e05e583c","resolution":{"observed_at":"2026-08-06T22:21:14.683118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T22:21:09.708524Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.708524Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:8ca707931f8c03d2b8e9669731834500c8d08e0a166b587dc4e6cbd1132ff8e3","observation_id":"e77e122a-9f1d-40f1-9926-4ca44946bdcc","resolution":{"observed_at":"2026-08-06T22:21:09.708524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:14.457824Z","title":"Learning deep transformer models for machine translation","venue":null,"work_id":"32387a6d-0986-4b04-93d4-1183e873dca7","year":2019},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.764755Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:73fd733887e81777b04a54d5857fc2f437364d0d551e9b45211f07eb123b7470","observation_id":"bc0dcd1f-e364-4b0a-bc50-bd37b63d1aa5","resolution":{"observed_at":"2026-08-06T22:21:14.545995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:14.348236Z","title":"Outlier weighed layerwise sparsity (owl): A missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":"bf496e19-dd79-4f3e-a6cd-b28c3c34f3eb","year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.865572Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:ed934d330efb0d8c3ea2835d815729ecb2579cdb45b27969fbcdf580824c5e1e","observation_id":"b457ab1c-8055-469a-b204-a5afb9ca33d8","resolution":{"observed_at":"2026-08-06T22:21:14.387759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-06T22:21:09.909236Z","title":"The unreasonable ineffectiveness of the deeper layers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.909236Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:6c0870df7ab0ecf094185941cd4b99a4ea2594fc793f6e264233b48c33229375","observation_id":"b716bc9a-db6d-4c36-bcd7-c917ef91e4cc","resolution":{"observed_at":"2026-08-06T22:21:09.909236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-06T22:21:10.026345Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.026345Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:4633fd112b658c0d027f5f664e177f5c1da66579deb2215a3a1d7e76a7ac6ad9","observation_id":"bbda0a57-d6e7-4e8b-84bd-8262e9067d5a","resolution":{"observed_at":"2026-08-06T22:21:10.026345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T22:21:10.068870Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.068870Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:e5ae41fd88812d94f6a425cf04dd13178f83815817cfceeb27d70583d14c3f3f","observation_id":"6d9c51fc-52b9-45eb-8887-1129ca86a587","resolution":{"observed_at":"2026-08-06T22:21:10.068870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13795","last_updated":"2025-08-04T10:49:54Z","snapshot_observed_at":"2026-08-05T13:37:28.213031Z","submitted_at":"2024-12-18T12:39:53Z","title":"Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13795","snapshot_observed_at":"2026-08-06T22:21:10.135364Z","title":"Mix-ln: Unleashing the power of deeper layers by combining pre-ln and post-ln","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.135364Z"},"links":{"cited_paper":"/paper/2412.13795","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:57fb099ee5157fc64f80efc25a323f05f4936deb0a0e8809942130c96445dfb4","observation_id":"a7ead766-3b43-466f-b27b-331c1a18ecf0","resolution":{"observed_at":"2026-08-06T22:21:10.135364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.187845Z","title":"The curse of depth in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.187845Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:c595c6d5d545c6c3a9b135847b4cf658c67d466cadc81134789e1e424e50025d","observation_id":"765c349a-a682-4772-b025-c7490566712c","resolution":{"observed_at":"2026-08-06T22:21:10.187845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:14.232134Z","title":"Deepnet: Scaling transformers to 1,000 layers","venue":null,"work_id":"3b0ba547-cc3a-4970-b8d3-4eecd752d551","year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.234776Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:808305c6ac80e77400b23858f7027ab1c35503fe042b45c7871f3011045943bc","observation_id":"b71d0a8e-4860-43bd-b0ab-c7d4c60477ef","resolution":{"observed_at":"2026-08-06T22:21:14.284486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:14.137968Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"809f79e6-9c42-4256-a4e7-6d05203d7c1e","year":2021},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.268765Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:421dbce202b1ae125d14526d24aa10940b9213bc6390e24fd5ef5cb71ff294af","observation_id":"19ca331f-9c38-4f44-bd14-3e0f5396d1dc","resolution":{"observed_at":"2026-08-06T22:21:14.176152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:14.034750Z","title":"Group normalization","venue":null,"work_id":"754dacae-3b21-440e-8019-821f9579a22a","year":2018},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.300584Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:e2b725609add76956e32d626cbcdc543ff9251d6f7a2888d27410afd5780e298","observation_id":"c04172f7-369d-4e02-a47b-9ef09d6682a4","resolution":{"observed_at":"2026-08-06T22:21:14.091570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:13.925385Z","title":"Root mean square layer normalization","venue":null,"work_id":"2d825390-bfdf-4cc6-b4b4-7f2f39705bec","year":2019},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.352396Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:c5b85c3d77d269094ac52d4c86f1db548f91411172cccfd1254007c062b78dcb","observation_id":"a22f81b1-924a-4493-a895-affa81442b78","resolution":{"observed_at":"2026-08-06T22:21:13.952220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.07013","last_updated":"2019-11-16T11:00:16Z","snapshot_observed_at":"2026-07-06T08:37:28.734352Z","submitted_at":"2019-11-16T11:00:16Z","title":"Understanding and Improving Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.07013","snapshot_observed_at":"2026-08-06T22:21:10.438131Z","title":"Understanding and improving layer normalization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.438131Z"},"links":{"cited_paper":"/paper/1911.07013","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:caa490d456417eb8620aaaf7335fbaa1632ea934c86a4eba123f682ac4c4f9fa","observation_id":"cce29769-20ca-4659-be46-5d740a038946","resolution":{"observed_at":"2026-08-06T22:21:10.438131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.515415Z","title":"Transformers without normalization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.515415Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:f66bab253135b844fa663e4213f7df47e181da3be6cf62bece3752e581876e21","observation_id":"0b006660-0b36-4b59-949b-c47f4450d93a","resolution":{"observed_at":"2026-08-06T22:21:10.515415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:13.788336Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":"f7f54d92-290a-4b9b-a9be-d512a474c9ab","year":2020},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.573822Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:23629e7c9bd2e6ac2c5c51e60d0da4b66a74a535d3edc8abed835d12cbc3f5ac","observation_id":"214245db-f125-4b6d-b055-c67a9c129e3f","resolution":{"observed_at":"2026-08-06T22:21:13.865768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:13.681011Z","title":"B2t connection: Serving stability and performance in deep transformers","venue":null,"work_id":"d847d29e-6cd5-4e94-9701-488359a98064","year":2023},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.615392Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:6d5030629d0f295255792f57207bd9cfb6506a5111f2177017d3ad6575210f42","observation_id":"accca324-9de0-47f8-b790-2b45b3eed285","resolution":{"observed_at":"2026-08-06T22:21:13.733130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02732","last_updated":"2025-06-06T11:19:11Z","snapshot_observed_at":"2026-07-06T20:31:13.063382Z","submitted_at":"2025-02-04T21:29:47Z","title":"Peri-LN: Revisiting Normalization Layer in the Transformer Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02732","snapshot_observed_at":"2026-08-06T22:21:10.661789Z","title":"Peri-ln: Revisiting normalization layer in the transformer architecture","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.661789Z"},"links":{"cited_paper":"/paper/2502.02732","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:55cb1d56b9d9232570f0a293898f9afc7942b512dfb360b01978841e7c35bfa8","observation_id":"5ed40db9-0ac8-49d2-9536-daa3fb9bbafe","resolution":{"observed_at":"2026-08-06T22:21:10.661789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-06T22:21:10.741333Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.741333Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:9d1e75733429f710e95919515a1de925bd2c4da06c3a5aecdb780f246b880df8","observation_id":"99d9f61f-7345-4669-8584-0e8a34e7dd7c","resolution":{"observed_at":"2026-08-06T22:21:10.741333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-06T22:21:10.769395Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.769395Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:f1f96831a4a3ce02b0a346d81920a90320aeee23a6730e8bc15f2d691bea5a65","observation_id":"b3be30c0-e5f2-4ecc-b23e-b4811567bf73","resolution":{"observed_at":"2026-08-06T22:21:10.769395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-06T22:21:10.825974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.825974Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:fd5cfb717d731f16b5786f45e6581eb1ff0a7f04b7aa1c85d669cd298a73def9","observation_id":"6d7f4837-08e2-4a40-b736-2a68eb5ec173","resolution":{"observed_at":"2026-08-06T22:21:10.825974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T22:21:10.900239Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.900239Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:dabc894684fdb9e2b0f587035f0c8b31b7a916a686f00da722ee126d8e45c0df","observation_id":"f6768497-b4eb-4e73-be14-ddcad43e1eb5","resolution":{"observed_at":"2026-08-06T22:21:10.900239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.954572Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.954572Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:dcb5662c71b15915decca025dfb924df55f84e2aeabb2a2b417b43af4a037584","observation_id":"90c34a68-cf92-43ca-b45b-4a76e4068468","resolution":{"observed_at":"2026-08-06T22:21:10.954572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:13.572869Z","title":"Relora: High- rank training through low-rank updates","venue":null,"work_id":"088fc143-70c5-483c-bcce-4b7edd474ebc","year":2023},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.014246Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:20aca900eae9669dc3e8ed6aff8acddb726bddb17260b617120ff8570fab9354","observation_id":"ed815e55-47d4-48ac-8f61-9bb187ea90f2","resolution":{"observed_at":"2026-08-06T22:21:13.595864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:13.451203Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":"07603e66-ce7a-435f-8095-87a977378f8d","year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.043414Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:793f951c0c63f18a4966e8b435eb53284f267a9db6cafa93174cca159596d502","observation_id":"8a8621e3-d424-4be8-a038-6fa8409f93d5","resolution":{"observed_at":"2026-08-06T22:21:13.528482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:13.294315Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context","venue":null,"work_id":"f21aba31-226b-4ac1-b11d-c2f7d1955b02","year":2019},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.118726Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:950786199bdb93ff598ba3f5bb2ca48801b03db0878c7d5f991774555877433d","observation_id":"6472a69a-7795-4c60-86c3-14ae6c78ed73","resolution":{"observed_at":"2026-08-06T22:21:13.357730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:13.136852Z","title":"Sandwich batch normal- ization: A drop-in replacement for feature distribution heterogeneity","venue":null,"work_id":"ea6f9df3-5b51-4997-bd11-c1660283c95c","year":2022},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.168935Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:429d5fb018c3389d71f3fb74cd4834a3f594429c9f167f14e01bc9cbc6a1e5a1","observation_id":"740f9556-949b-4e22-a5cd-91292529a5ab","resolution":{"observed_at":"2026-08-06T22:21:13.196929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:21:11.222328Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.222328Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:69e0aa806c859f62ee43faca1ae580a20ca4aca2326b22e042760bb8a12a38cb","observation_id":"bc3ca830-ae9d-4668-b417-79cd9809d6bc","resolution":{"observed_at":"2026-08-06T22:21:11.222328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-06T22:21:11.265526Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.265526Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:3a3880dc0db952c0bae4d967b5f26027a896e24114cf2298bd35f9b77af8ed29","observation_id":"5ac6186a-dee7-43ad-b92c-55d3030089bc","resolution":{"observed_at":"2026-08-06T22:21:11.265526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-07-06T17:09:10.513197Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-06T22:21:11.325852Z","title":"Spike no more: Stabilizing the pre-training of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.325852Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:5317dd6cb1b7163ae5f36f7b9d74e860cd859db5ef26643ec84dc634762814b2","observation_id":"992f5f56-b36b-417e-bdae-16dc89ca8156","resolution":{"observed_at":"2026-08-06T22:21:11.325852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.886793Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"4c54b606-db2b-4ba6-8365-1905258cedb4","year":2015},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.363870Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:48e4d2aecf12d770dd49cb9d677f956f6ee885662108bfed59e92bdeb49b7984","observation_id":"bfb1a337-b77a-4518-b7f5-97fef0e6e41c","resolution":{"observed_at":"2026-08-06T22:21:13.057360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.394382Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.394382Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:033091dce444c048f5a0b865d6dcc694eafc35eaa0f0c7b9491fc1eebd5a4d21","observation_id":"182ed576-34bf-4d7f-95f1-448bcf0a792b","resolution":{"observed_at":"2026-08-06T22:21:11.394382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.786089Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus, 2021","venue":null,"work_id":"62116ebf-4cc2-4006-a42d-f368a831b1b3","year":2021},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.433172Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:4c30fdb249afdb13f1c4927c2d151c88817eb3a1bbc5fb71a9bd0002e8cf53c3","observation_id":"3d83aa1b-b6b4-4f13-9356-d47e3b1b86a0","resolution":{"observed_at":"2026-08-06T22:21:12.830440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.591252Z","title":"Llm-adapters: An adapter family for parameter-efficient fine-tuning of large language models","venue":null,"work_id":"e819e617-a75f-4dfd-9662-854fa71478a2","year":2023},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.518549Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:3a4c7b273ca3da997f79eb9bec9dea01ce8acd7acffb8f15f78416294d02b365","observation_id":"7be4cea1-d926-40e8-83b3-286c529a8def","resolution":{"observed_at":"2026-08-06T22:21:12.697867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.384349Z","title":"Lisa: Layerwise importance sampling for memory-efficient large language model fine-tuning","venue":null,"work_id":"d7170931-8926-40da-ad90-f40d456c6d76","year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.584659Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:fc404fc6affe0144f779bf0b13c49b387b2330aa8ceaaa118150eace2bf0b649","observation_id":"8d26608b-4133-44f8-9cb5-2b2c2635f1f1","resolution":{"observed_at":"2026-08-06T22:21:12.512251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.650939Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.650939Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:d26243a84b149f47cb1a0058dd00871ea911ce25a42585f2113f76a2814baba5","observation_id":"fb50ee85-7b04-441f-8740-cd7134cf8679","resolution":{"observed_at":"2026-08-06T22:21:11.650939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.722895Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.722895Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:324c4fa57bc60d56f7863b879bb61d084f0a4bef2109c0d155e46e0f5c1b4d9f","observation_id":"f67d85ab-c70e-4247-817e-8c9c74823dcb","resolution":{"observed_at":"2026-08-06T22:21:11.722895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.151320Z","title":null,"venue":null,"work_id":"2e4db385-bcd7-4692-b874-199b309246db","year":1996},"citing_paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:11.749664Z"},"links":{"citing_paper":"/paper/2506.22049"},"observation_digest":"sha256:d72c53297fb1e2400a45d386b758336340f70d48db006fef4a2cd269a9d829eb","observation_id":"bf37f784-a868-4bb5-9853-f70e99755612","resolution":{"observed_at":"2026-08-06T22:21:12.211536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22049","last_updated":"2025-07-03T16:54:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T23:11:38.262545Z","submitted_at":"2025-06-27T09:45:15Z","title":"GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2506.22049."}