{"as_of":"2026-08-08T00:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae536836b6cdd44726490a1b0a5ae4a084884fc1d809df73ef7ed55b787e263a","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:31:18.269637Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:11:43.051506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:35:51.305374Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2510.23912","last_updated":"2026-04-23T06:11:56Z","snapshot_observed_at":"2026-08-04T11:05:56.199122Z","submitted_at":"2025-10-27T22:39:34Z","title":"Key and Value Weights Are Probably All You Need: On the Necessity of the Query, Key, Value weight Triplet in Self-Attention Transformers","version":7},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T03:38:36.932424Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2510.23912"},"observation_digest":"sha256:f843e48637638efeb4ce3889505a7960308a217732c68fcafe446d889312d0a7","observation_id":"c1b618d1-fb46-4671-98c7-5601df990771","resolution":{"observed_at":"2026-05-18T03:40:50.558061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-08-03T03:11:43.051506Z","title":"io/Inverse_Tracr.pdf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08857","last_updated":"2026-06-05T13:59:44Z","snapshot_observed_at":"2026-08-06T16:49:20.566067Z","submitted_at":"2026-02-09T16:22:29Z","title":"Discovering Interpretable Algorithms by Decompiling Transformers to RASP","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:11:43.051506Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2602.08857"},"observation_digest":"sha256:75f50f606a5420a610dcbb4dd8205d4f1d1bf8d717309501b57613184b3aca83","observation_id":"84b8c5e9-ed7f-4d58-a553-8e19648e3cd2","resolution":{"observed_at":"2026-08-03T03:11:43.051506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2602.10408","last_updated":"2026-05-19T21:29:01Z","snapshot_observed_at":"2026-08-01T12:13:46.685645Z","submitted_at":"2026-02-11T01:40:34Z","title":"Gated Normalization Removal and Scale Anchoring in Pre-Norm Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T14:19:46.400753Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2602.10408"},"observation_digest":"sha256:125e4deb7c6a76bad0d3d2d355ebdad53a4f68489ab51b7f7fd33d7919fd700b","observation_id":"23ef7d84-e166-4f62-8de0-541ef57c2998","resolution":{"observed_at":"2026-05-21T14:20:13.540889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2604.07098","last_updated":"2026-05-11T15:12:11Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T13:51:07Z","title":"Selective Neuron Amplification in Transformer Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:31:17.182481Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2604.07098"},"observation_digest":"sha256:25a09f0ce6228be433e267caded85412eb0ab02df5e7f45b722ec691d16a0d7b","observation_id":"5ac88c08-06e6-441e-ba65-605d304cf889","resolution":{"observed_at":"2026-05-11T00:25:52.362679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2604.07098","last_updated":"2026-05-11T15:12:11Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T13:51:07Z","title":"Selective Neuron Amplification in Transformer Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:28:05.507808Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2604.07098"},"observation_digest":"sha256:3363b796255aed478f21b77b590ab57a7eb42cf325ac9dc9303c74c2165de39a","observation_id":"42cc7a73-a64c-458f-9f99-2e469bff0c8f","resolution":{"observed_at":"2026-05-12T06:16:25.133581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2605.24033","last_updated":"2026-07-29T02:27:43Z","snapshot_observed_at":"2026-08-02T13:29:53.230695Z","submitted_at":"2026-05-21T05:21:40Z","title":"Towards Verifiable Transformers: Solver-Checkable Circuit Explanations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:47:13.178911Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2605.24033"},"observation_digest":"sha256:99cf63d7e4732597f3db6ec827a586368e8428492082cac5e384c162b9fa6ef1","observation_id":"a0fa120d-8d23-4b81-b0b6-15533262c7e2","resolution":{"observed_at":"2026-07-01T15:05:48.064804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-08-02T13:29:53.932972Z","title":"Transformers Don’t Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.24033","last_updated":"2026-07-29T02:27:43Z","snapshot_observed_at":"2026-08-02T13:29:53.230695Z","submitted_at":"2026-05-21T05:21:40Z","title":"Towards Verifiable Transformers: Solver-Checkable Circuit Explanations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T13:29:53.932972Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2605.24033"},"observation_digest":"sha256:fde7d86edaf89b0f518bfc7363d6faf2e46519f04f03aa02f9fd63a236c676dd","observation_id":"b342e9cf-cb1f-4e01-bfaa-8a2cddd8a182","resolution":{"observed_at":"2026-08-02T13:29:53.932972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-29T03:35:34.594617Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:6df8b7bacdfc13d51d2d958cbbd1531d8466e3913165f8c820ca00e8ff7c47bc","observation_id":"a357d3c0-3e46-4594-874e-a9d86d4d0a92","resolution":{"observed_at":"2026-07-01T17:35:51.306825Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-30T09:32:59.824110Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:12100109624ca024bd17e14dfba0a3a5fcabb7a9f9bda611fb54e6281ec9be53","observation_id":"7dc6d4e6-4bc0-4830-a4e2-274b3eaefe57","resolution":{"observed_at":"2026-06-30T09:34:34.461654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02559/citation-record","integrity":"/paper/2507.02559/integrity","json":"/paper/2507.02559/citation-record.json","paper":"/paper/2507.02559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.056089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.056089Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:276c87353a138159506369f9448dac635b7b4c81fba5a5f82ebb9f82a2ee624f","observation_id":"c869a743-df52-4b73-b291-c0d95f896c6b","resolution":{"observed_at":"2026-08-06T20:31:15.056089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.172686Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.172686Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:f22ae121d370f9efc5e7bba77c466df2a6eb50c444ecefdf55d229ac01c473ea","observation_id":"c0c8e58f-c08b-40df-acbc-810dffbea027","resolution":{"observed_at":"2026-08-06T20:31:15.172686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02732","last_updated":"2025-08-05T16:43:21Z","snapshot_observed_at":"2026-08-07T16:10:59.155123Z","submitted_at":"2025-04-03T16:17:55Z","title":"Why do LLMs attend to the first token?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02732","snapshot_observed_at":"2026-08-06T20:31:15.257797Z","title":"Why do LLMs attend to the first token? arXiv preprint arXiv:2504.02732, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.257797Z"},"links":{"cited_paper":"/paper/2504.02732","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d4f632afba2e4e38b3b5dea5c98a8a8b96eb7109f210cc784e072a1b38628f06","observation_id":"e041b568-94b6-450a-a69f-aece269aa919","resolution":{"observed_at":"2026-08-06T20:31:15.257797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.344778Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.344778Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:5ce0248ed1bad94f5dafa7ffe653d0c415ece30bd288b81e6252211f7ca87698","observation_id":"11fdb6d2-f6eb-4844-bea2-6740f89faba2","resolution":{"observed_at":"2026-08-06T20:31:15.344778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10928","last_updated":"2024-05-20T16:34:37Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:27:19Z","title":"The Local Interaction Basis: Identifying Computationally-Relevant and Sparsely Interacting Features in Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10928","snapshot_observed_at":"2026-08-06T20:31:15.407102Z","title":"a nni, Avery Griffin, J \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.407102Z"},"links":{"cited_paper":"/paper/2405.10928","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:bf04d6c6a02a8430876891d86490c5ef21f972273cf058727f0e04ddb2e46b2b","observation_id":"dde8764f-8c93-4737-b02f-420c9baa97b3","resolution":{"observed_at":"2026-08-06T20:31:15.407102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.553041Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.553041Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:752cb73a42f8a03467152ec9efb938b964c9ff5b854fd3fa39d3a49291fc169c","observation_id":"42a3c983-8edd-4529-9f24-b064e7bff7fc","resolution":{"observed_at":"2026-08-06T20:31:15.553041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18147","last_updated":"2025-06-06T11:10:03Z","snapshot_observed_at":"2026-08-07T17:50:17.102928Z","submitted_at":"2025-02-25T12:21:45Z","title":"Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18147","snapshot_observed_at":"2026-08-06T20:31:15.674321Z","title":"Jacobian sparse autoencoders: Sparsify computations, not just activations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.674321Z"},"links":{"cited_paper":"/paper/2502.18147","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:33715443691965b00b54a7b1603cb1bfbbb708e0540087ab232327ea3f01bdf5","observation_id":"e68b7bf3-5b83-4e2e-bd7f-67b328e240c4","resolution":{"observed_at":"2026-08-06T20:31:15.674321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-06T20:31:15.779455Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.779455Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:00dd21eda2e2cb55e31026a69ed376697c38d0cbc9d10c2e2cb7a2d06993885e","observation_id":"d20ea447-be10-4c78-90b7-ed412a0a938a","resolution":{"observed_at":"2026-08-06T20:31:15.779455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.884759Z","title":"Finding alignments between interpretable causal variables and distributed neural representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.884759Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:de26fba9ab6a5352eda64eda1c43c0fc874240c1875d1bbec33f818954611c2e","observation_id":"798e706f-9568-4c43-9375-68cdc5b1949b","resolution":{"observed_at":"2026-08-06T20:31:15.884759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T20:31:15.963355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.963355Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:28172259d210dc4b01a8aa0dc0151cf0d89feedbcdfd8596504e1d0536bce37d","observation_id":"e73c837d-6e25-471b-a3a7-fab05156562f","resolution":{"observed_at":"2026-08-06T20:31:15.963355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:16.060049Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.060049Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d67c1a241fc12fcb5fa1c714a3b6a0b1338959bd9afb0fb50836a620d74ea915","observation_id":"fb4e697c-81f2-4f85-a760-a354b24aa4d9","resolution":{"observed_at":"2026-08-06T20:31:16.060049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:21.669980Z","title":"Geometric interpretation of layer normalization and a comparative analysis with rmsnorm, 2025","venue":null,"work_id":"8c37a3b3-dc77-4bce-9c66-1aa80bf6ca4c","year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.177715Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:dba8a338d5c3c9a13b194f81c073fe64814deaa5c86f6d90a0e5295268b17d07","observation_id":"111d19bb-32ae-4288-b298-63ef7fc93219","resolution":{"observed_at":"2026-08-06T20:31:21.767788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:21.560477Z","title":"Universal neurons in gpt2 language models","venue":null,"work_id":"35551d6c-0412-4eab-9c87-371467fe827d","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.231561Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:a65a14358a4d703adfb33c11a72ca50eae7df61f5f13a818410c58c2500e80b0","observation_id":"7239c004-3271-4d79-b952-90e028f687bd","resolution":{"observed_at":"2026-08-06T20:31:21.597286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:21.250832Z","title":"You can remove gpt2's LayerNorm by fine-tuning","venue":null,"work_id":"ebcfd87b-5eb5-4238-9453-67e7ade75e72","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.288441Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:3bd50f4626196a2a58c39dfb34805c562180ebc887d7e121e29dd43af37c124e","observation_id":"99434904-f61f-4b34-a984-1539183175a3","resolution":{"observed_at":"2026-08-06T20:31:21.426689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15255","last_updated":"2024-04-23T17:42:29Z","snapshot_observed_at":"2026-07-31T21:25:53.647335Z","submitted_at":"2024-04-23T17:42:29Z","title":"How to use and interpret activation patching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15255","snapshot_observed_at":"2026-08-06T20:31:16.371013Z","title":"How to use and interpret activation patching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.371013Z"},"links":{"cited_paper":"/paper/2404.15255","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:97fcceb1608819bacf76e1e9e91d7b14f795003d930204090281a2528a5ae55b","observation_id":"fe9d0fef-a56e-4bdb-be57-c2ff16090900","resolution":{"observed_at":"2026-08-06T20:31:16.371013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.959429Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":"eb8f81fb-294a-463c-b695-a694721cd2a9","year":2015},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.500310Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:845bc0ddbef6d227f8fcb1e822ad3de268db34ca5f2da1c534eb612fbca88522","observation_id":"b1b3b626-81be-4d72-90fb-0700bf0324e7","resolution":{"observed_at":"2026-08-06T20:31:21.086538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.705693Z","title":"Visit: Visualizing and interpreting the semantic information flow of transformers","venue":null,"work_id":"009ed894-4f04-4f33-8cb9-fcddfa63c160","year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.581740Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:2d5d2671915f749e097ac8daedb177f58d0f255f16408246f4581eb74c3ad287","observation_id":"d04f406e-d069-4c5b-9e81-7b1851e40253","resolution":{"observed_at":"2026-08-06T20:31:20.802792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.516107Z","title":"Sparse autoencoders work on attention layer outputs, Jan 2024","venue":null,"work_id":"f8fa3231-8524-4a1b-a65f-40614b711990","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.661983Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:9f699df83060cb94a52d31ea312b54d1b674003f90ad50480e5703b9d962b7d1","observation_id":"a35f9380-5228-4bcf-a980-eda9ca20e0e7","resolution":{"observed_at":"2026-08-06T20:31:20.597517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:16.726988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.726988Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:81709a1c3a6f2ddd0f29f5585e01a57b019a35a368dc99280f5961d1a08b3237","observation_id":"2c399d03-4f48-4f46-bda9-872795db513b","resolution":{"observed_at":"2026-08-06T20:31:16.726988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-06T20:31:16.822219Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.822219Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:91156a14aec9c10b17c2d975174002bae15029cba493917b13dc5cd86211131e","observation_id":"546eccdf-40c9-4f50-8908-d8228a2951a3","resolution":{"observed_at":"2026-08-06T20:31:16.822219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04625","last_updated":"2023-10-06T23:37:24Z","snapshot_observed_at":"2026-07-06T16:29:03.404736Z","submitted_at":"2023-10-06T23:37:24Z","title":"Copy Suppression: Comprehensively Understanding an Attention Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04625","snapshot_observed_at":"2026-08-06T20:31:16.921232Z","title":"Copy Suppression: Comprehensively Understanding an Attention Head","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.921232Z"},"links":{"cited_paper":"/paper/2310.04625","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:44dee9d5dcee8738d447cd5f93f2c159100538dcff907f84b855ceb29c5300c5","observation_id":"d07e6a75-ee99-41cb-86a3-0bb1d54231b9","resolution":{"observed_at":"2026-08-06T20:31:16.921232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-07-06T12:36:34.388460Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-06T20:31:17.012912Z","title":"Locating and editing factual associations in GPT","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.012912Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:42972d1c4c548ad0b90bf9c6198edf695e7819ac1598e57b90752805394ede7a","observation_id":"b3392b0e-1386-4c5d-8410-29acc96e6ab1","resolution":{"observed_at":"2026-08-06T20:31:17.012912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.435257Z","title":"Tinymodel: A tinystories lm with saes and transcoders, 2024","venue":null,"work_id":"f6356352-6fa3-4bc5-b06f-afe49309be4f","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.087598Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:4fe3d7167525ca7ca09fd0ccaa57761969649954e5f7452cd74c01aadae95590","observation_id":"9be48507-3147-49c3-8d30-9f26f23fa5fe","resolution":{"observed_at":"2026-08-06T20:31:20.467692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.309895Z","title":"Attribution patching: Activation patching at industrial scale, Mar 2023 a","venue":null,"work_id":"ff2f04f1-aa05-4131-a823-e0669a18f593","year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.142216Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:6d0b8269be4008052d77d1a5bae198901be673eb946a43a2251227d077d056a4","observation_id":"aa89992e-cd0f-4ba6-8fe5-32689f46f113","resolution":{"observed_at":"2026-08-06T20:31:20.385237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.181656Z","title":"Exploratory analysis demo (transformerlens)","venue":null,"work_id":"7f1e1b0d-0742-46c8-bf87-168a24a919e9","year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.226190Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:e87172c823de691853030d5539dbede17fde9c5e15f0941bba73f5e9b74b975e","observation_id":"4c84a2a1-d6f1-4065-82e7-f136d1c90939","resolution":{"observed_at":"2026-08-06T20:31:20.225301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:17.293516Z","title":"Transformerlens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.293516Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:529a64c3085505386f337bd03ea7ba96854bb9f0088c845ae14de120013b9009","observation_id":"1dd69c8d-38aa-4cca-8965-b2d0889424cd","resolution":{"observed_at":"2026-08-06T20:31:17.293516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.030702Z","title":"interpreting gpt: the logit lens, Aug 2020","venue":null,"work_id":"cafcc74e-856c-48f7-bfe1-ece10f7d6ce7","year":2020},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.362337Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:8f5be45a6193fbddf6a8e9ad2da1ae90be9ef0d845f7265230a4401c3fee450d","observation_id":"f971a940-3747-46ba-bae3-76ae16767369","resolution":{"observed_at":"2026-08-06T20:31:20.082358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:17.418514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.418514Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:5411b06fe41618c1483595ec26e56be6555d267cd4b716b53470cf9390a7e8b9","observation_id":"e749d544-cfd0-4e1b-9617-f80df5827e35","resolution":{"observed_at":"2026-08-06T20:31:17.418514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:19.246209Z","title":"Direct and indirect effects","venue":null,"work_id":"9ed7996f-357f-410d-8b56-509d557d6ba8","year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.474033Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d40ecc1dde2d02b53380240938d01ae1271319712008b9a6529f135a61dbd354","observation_id":"4ddc0416-7fcc-431f-8e6a-17f5efd33b43","resolution":{"observed_at":"2026-08-06T20:31:19.538617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16254","last_updated":"2024-11-08T12:54:16Z","snapshot_observed_at":"2026-08-04T15:45:35.991489Z","submitted_at":"2024-06-24T01:31:03Z","title":"Confidence Regulation Neurons in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16254","snapshot_observed_at":"2026-08-06T20:31:17.531668Z","title":"Confidence regulation neurons in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.531668Z"},"links":{"cited_paper":"/paper/2406.16254","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:cabd6a41d926c12551881c46fe1afd1af2a91cdbe67402f0688c52d2eb7e7217","observation_id":"9a41a79c-d3f2-494b-bef6-e251be332513","resolution":{"observed_at":"2026-08-06T20:31:17.531668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:31:17.573752Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.573752Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:ef608f88b5402a0c95b2d22753029f40a9a11bfd6c4edc35eb562de9cdffbd0d","observation_id":"f1e544b0-9800-4f08-b4d3-7f091708f47a","resolution":{"observed_at":"2026-08-06T20:31:17.573752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:17.639147Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.639147Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:59335610debd9a80218b3e16a6e0250d322ea1a650714610af1968b48588052d","observation_id":"9a14a053-66b1-48d6-9c44-fe69d155270f","resolution":{"observed_at":"2026-08-06T20:31:17.639147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.979032Z","title":"Understanding the failure of batch normalization for transformers in nlp","venue":null,"work_id":"00d41469-1874-44e9-b250-c3e96b65632b","year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.702651Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:9af0d9448a0fc598c00a53c0eec316127d8ad91f9a231fb67007977f15a78a9c","observation_id":"2c55ad8d-8a26-4887-b6e2-0b7c0c681830","resolution":{"observed_at":"2026-08-06T20:31:19.058706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T20:31:17.798498Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.798498Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:8a4f6361e84667a45104a210f272414591f68b800d46454ab43b826530a2cddf","observation_id":"a1e61622-ebda-4274-882d-000351d125d4","resolution":{"observed_at":"2026-08-06T20:31:17.798498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.760648Z","title":"Re-examining layernorm","venue":null,"work_id":"cd59827a-addd-4485-9a52-04c474ef55d8","year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.865032Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:0a9071e0b2e3842528241ba5922ea2223edab73fc497b6bdab322bc2ad0016a4","observation_id":"51304b89-5000-4a5d-90fe-45a9839812db","resolution":{"observed_at":"2026-08-06T20:31:18.869243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T20:31:17.953864Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.953864Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:a1a4c909829266b9fdf9d7c02f7f07f79da10c44fa409a0c256f12ae81893d8b","observation_id":"36a28ddc-1ade-4255-aca7-410308e28a62","resolution":{"observed_at":"2026-08-06T20:31:17.953864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08908","last_updated":"2025-03-11T21:40:58Z","snapshot_observed_at":"2026-08-07T17:11:42.101660Z","submitted_at":"2025-03-11T21:40:58Z","title":"Interpreting the Repeated Token Phenomenon in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08908","snapshot_observed_at":"2026-08-06T20:31:18.044410Z","title":"Interpreting the repeated token phenomenon in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.044410Z"},"links":{"cited_paper":"/paper/2503.08908","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:3c0263e43ae2fa8c7f67b24e350be80e09f08d23fd124f9c4fb4b512aa77e416","observation_id":"0e012156-7341-48ac-9b01-fb96607b4c76","resolution":{"observed_at":"2026-08-06T20:31:18.044410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.138243Z","title":"Root mean square layer normalization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.138243Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:4dc072dd06108f53bc23424939931c143ae44aa26496d97cc0ecbc3810861bfd","observation_id":"44f04f6d-ef34-414e-be54-aa848e4d1365","resolution":{"observed_at":"2026-08-06T20:31:18.138243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16042","last_updated":"2024-01-17T04:07:06Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:53:56Z","title":"Towards Best Practices of Activation Patching in Language Models: Metrics and Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16042","snapshot_observed_at":"2026-08-06T20:31:18.203317Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.203317Z"},"links":{"cited_paper":"/paper/2309.16042","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:34a87ea19d645993f2338644f81da316b3a5a3506565f8b7b0326ed90bf683ca","observation_id":"d1634cc7-c2df-4015-bd8e-792616b6dc9b","resolution":{"observed_at":"2026-08-06T20:31:18.203317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.606501Z","title":"Transformers without normalization, 2025","venue":null,"work_id":"0593e5d5-246c-4d54-9fac-d845687d062a","year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.269637Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:91537ae1d0d77f6a1d8acad3b2000aa2f43d4de62c062ce177b27e758798af53","observation_id":"f9d3462e-56da-4ec7-8cf4-b8fc3231803d","resolution":{"observed_at":"2026-08-06T20:31:18.679971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:23:50.417046Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 9 inbound Pith citation observations for arXiv:2507.02559."}