{"as_of":"2026-08-24T04:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d41bb01c7457023346cb46ba975092cd78cac6a4cebd891f7b3ddd951b20768","coverage":[{"denominator":159,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T07:02:53.740597Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":102,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:06:57.523801Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T09:58:29.057357Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2406.02069"},"observation_digest":"sha256:37787128852f1a79de81449d7239c430cc3b179a6f05ef89c01fe9cba30f13ea","observation_id":"0f564b89-e117-4001-8b73-a4d58afb5382","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T17:47:23.089288Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2406.04093"},"observation_digest":"sha256:4bad71db2c5f8c012c5326cb0ce3808770f62cc494635318ac55256304c49901","observation_id":"09dd05df-56e3-4318-9adf-f4a805d11c3b","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-21T17:06:41.051723Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T19:45:36.337956Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2407.08608"},"observation_digest":"sha256:f106e78ad549f7b84af5c89cc195abbd357b784bccd422547bd6e1f59ebfd5c3","observation_id":"b383fa3f-ff15-4c4f-8dea-dbca88241704","resolution":{"observed_at":"2026-05-20T19:45:36.442032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-17T16:25:55.906179Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T17:41:03.674759Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2410.10781"},"observation_digest":"sha256:9debf0401552c20f059fe8f3c7d3c4283a720db0bb81979e34dc04c317353ad6","observation_id":"6ba80cee-860c-4379-af58-912b3c3f9c9f","resolution":{"observed_at":"2026-05-16T17:41:03.745535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-12T16:30:21.317662Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13476","last_updated":"2024-11-26T09:46:25Z","snapshot_observed_at":"2026-08-19T06:11:16.023977Z","submitted_at":"2024-11-20T17:22:31Z","title":"When Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context Training","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T16:30:21.317662Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2411.13476"},"observation_digest":"sha256:313114204babe33d534171870f64d161374e0adddafa9fb9200290f44d6163b2","observation_id":"12916e7a-8ac9-475f-9935-e4e8a7a1d8fc","resolution":{"observed_at":"2026-08-12T16:30:21.317662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-12T15:08:54.393582Z","title":"Massive activations in large language models.arXiv preprint arXiv:2402.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-17T16:26:41.425114Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.393582Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:c1c5dd87819d2e8562216f72e6602203bae13c7f4c4179ad8eb6c454183ac0b7","observation_id":"fd48f046-aa25-41ac-bf2b-ac475226fc33","resolution":{"observed_at":"2026-08-12T15:08:54.393582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-12T05:20:23.900797Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00648","last_updated":"2025-07-15T15:36:44Z","snapshot_observed_at":"2026-08-19T21:19:30.100379Z","submitted_at":"2024-12-01T02:55:08Z","title":"DFRot: Achieving Outlier-Free and Massive Activation-Free for Rotated LLMs with Refined Rotation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:20:23.900797Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2412.00648"},"observation_digest":"sha256:79652dd1539850988a0d0af2f2541e592efc4ad4838eb711abf08ccbf77e9f24","observation_id":"99fdcb51-0b0b-4fd4-a04a-5cb8a1238b9b","resolution":{"observed_at":"2026-08-12T05:20:23.900797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-12T04:40:19.584749Z","title":"Massive activations in large language models.arXiv preprint arXiv:2402.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01199","last_updated":"2024-12-02T07:05:39Z","snapshot_observed_at":"2026-08-17T18:54:15.379489Z","submitted_at":"2024-12-02T07:05:39Z","title":"TinyFusion: Diffusion Transformers Learned Shallow","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:40:19.584749Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2412.01199"},"observation_digest":"sha256:88342051eef61db27d0839ed50d5274d17f9feb6a75b9a453f36e57f1e304bfe","observation_id":"a53fad53-d3fa-47da-a067-5aa36e15bb28","resolution":{"observed_at":"2026-08-12T04:40:19.584749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-11T15:23:56.974512Z","title":"Z.; and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11076","last_updated":"2025-01-17T07:21:34Z","snapshot_observed_at":"2026-08-20T09:13:49.035583Z","submitted_at":"2024-12-15T06:20:41Z","title":"MoRe: Class Patch Attention Needs Regularization for Weakly Supervised Semantic Segmentation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T15:23:56.974512Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2412.11076"},"observation_digest":"sha256:c1785a05200186257a14b3ebd388995122ef80e49a841aade7197957d218411e","observation_id":"b425e016-3674-438a-b52d-afd409cf979b","resolution":{"observed_at":"2026-08-11T15:23:56.974512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-11T00:38:46.996829Z","title":"Massive activations in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-20T14:01:46.841630Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:46.996829Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:240461eead77bcd52b23391f6edc2d8399a558c7b01e343148bb6a606b1916af","observation_id":"6e72f8a0-3c79-43c0-a4c8-d86e78caafb8","resolution":{"observed_at":"2026-08-11T00:38:46.996829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-10T21:29:37.720335Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04784","last_updated":"2025-01-08T19:02:32Z","snapshot_observed_at":"2026-08-18T09:50:56.904388Z","submitted_at":"2025-01-08T19:02:32Z","title":"Leveraging Registers in Vision Transformers for Robust Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:29:37.720335Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2501.04784"},"observation_digest":"sha256:e0f65d8371d226e036190086882430b8236cbe2b8b12d8b96a575f4f1e3af225","observation_id":"d54ef8b7-9dd2-4ba5-a3cb-254468d55c91","resolution":{"observed_at":"2026-08-10T21:29:37.720335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-10T14:46:02.668507Z","title":"Massive activations in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15021","last_updated":"2025-01-25T02:01:56Z","snapshot_observed_at":"2026-08-20T08:47:06.313589Z","submitted_at":"2025-01-25T02:01:56Z","title":"AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:02.668507Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2501.15021"},"observation_digest":"sha256:d9ac781c66437750c8eb96bdc3167ce815355d38e166711c61352cd356dfb3b6","observation_id":"036eb6bc-19f3-4c1e-879b-2877d18b95b1","resolution":{"observed_at":"2026-08-10T14:46:02.668507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-10T14:54:22.715681Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-18T23:10:12.488042Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:54:22.715681Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2501.16383"},"observation_digest":"sha256:0a5d50f8dfdb1806d543b69bcdb9750c828e3fdcb3600c3416ef3cae6e3a275c","observation_id":"91fcc470-d158-4f3a-9e65-32c8a9810006","resolution":{"observed_at":"2026-08-10T14:54:22.715681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-09T16:47:23.623705Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01070","last_updated":"2025-08-25T06:01:25Z","snapshot_observed_at":"2026-08-12T16:29:34.108900Z","submitted_at":"2025-02-03T05:26:22Z","title":"An Inquiry into Datacenter TCO for LLM Inference with FP8","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T16:47:23.623705Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2502.01070"},"observation_digest":"sha256:cd6dcd5860a0f6b02b66ccfa2ef4264a51b062c3eb8c34131abde7186b09e9f4","observation_id":"ceeaf3e5-1f44-4d4d-8e3c-c1ce36297e03","resolution":{"observed_at":"2026-08-09T16:47:23.623705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-09T11:23:40.993209Z","title":"Z., and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02732","last_updated":"2025-06-06T11:19:11Z","snapshot_observed_at":"2026-08-17T01:30:08.653623Z","submitted_at":"2025-02-04T21:29:47Z","title":"Peri-LN: Revisiting Normalization Layer in the Transformer Architecture","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T11:23:40.993209Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2502.02732"},"observation_digest":"sha256:56791171d57cbee5e304117f2879de22d190786bcac852b8b0e6d10d6de546e4","observation_id":"94b3edb7-d041-4212-bc15-c788e160fcef","resolution":{"observed_at":"2026-08-09T11:23:40.993209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-08T15:37:37.525550Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06415","last_updated":"2025-02-26T01:59:40Z","snapshot_observed_at":"2026-08-21T00:01:44.532342Z","submitted_at":"2025-02-10T12:54:17Z","title":"Systematic Outliers in Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T15:37:37.525550Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2502.06415"},"observation_digest":"sha256:7cf8fc3ba46f03646c5752e05adeb5cb94e861bac94310cb42a94b182891f03b","observation_id":"2ac3d208-f294-4d75-aeee-520b786000be","resolution":{"observed_at":"2026-08-08T15:37:37.525550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T06:06:57.523801Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19274","last_updated":"2025-05-26T14:20:07Z","snapshot_observed_at":"2026-08-20T03:15:43.661490Z","submitted_at":"2025-04-27T15:14:09Z","title":"TeleSparse: Practical Privacy-Preserving Verification of Deep Neural Networks","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T06:06:57.523801Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2504.19274"},"observation_digest":"sha256:80d763288afe16f22a79857be12b058126a4eb9b10cc7bda734be696d2654d2a","observation_id":"5341b35f-be30-4e0b-9ff7-fad88cf968c5","resolution":{"observed_at":"2026-08-16T06:06:57.523801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T05:58:23.672217Z","title":"Z., and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-19T10:02:26.423225Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:23.672217Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:e88a4c4b6e6e90e7c3ab9f3b4d9a74ff83e23da74b986151731c5344fe64bdbc","observation_id":"eb2872e6-71dd-45b3-9642-d1d671307c1f","resolution":{"observed_at":"2026-08-16T05:58:23.672217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T05:05:12.907873Z","title":"arXiv preprint arXiv:2402.17762 (2024) Precision Where It Matters 15","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-19T11:11:03.926246Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.907873Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:a4b57f15cbe74806f5db8578f79e2ad103906006ab6b5493e042586a3be93ff8","observation_id":"45cac19a-40ed-437a-98ad-ca2e1c43b986","resolution":{"observed_at":"2026-08-16T05:05:12.907873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T04:43:49.755531Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00850","last_updated":"2025-08-24T17:28:50Z","snapshot_observed_at":"2026-08-21T01:52:48.360295Z","submitted_at":"2025-05-01T20:23:29Z","title":"ICQuant: Index Coding enables Low-bit LLM Quantization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:43:49.755531Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.00850"},"observation_digest":"sha256:b7d3f76c9221325e6f4c992ec9792af9de5b2517afbc0d3d0a9153a34341bb4d","observation_id":"a506b6ff-1d76-45c4-9e54-27ef1cced7a3","resolution":{"observed_at":"2026-08-16T04:43:49.755531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-15T23:01:20.142490Z","title":"Z., and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05799","last_updated":"2025-05-09T05:32:21Z","snapshot_observed_at":"2026-08-22T01:16:41.956202Z","submitted_at":"2025-05-09T05:32:21Z","title":"MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T23:01:20.142490Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.05799"},"observation_digest":"sha256:31a4cbf63280a548bc33563fdf356e9cb5156724f282ab7740a136990f031e9f","observation_id":"bc90ad85-5426-4828-a92f-99e0c69fa85e","resolution":{"observed_at":"2026-08-15T23:01:20.142490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-08-14T13:38:50.524779Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:a3e3f2756c8658052fea249ac90d78b09bb4cf4683f6caa776ccc2c6e9a00124","observation_id":"8d42df7f-ea28-419d-9a80-f2464a4d062b","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T05:04:37.521728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07831","last_updated":"2025-04-30T12:33:28Z","snapshot_observed_at":"2026-08-18T23:25:49.809211Z","submitted_at":"2025-04-30T12:33:28Z","title":"Polysemy of Synthetic Neurons Towards a New Type of Explanatory Categorical Vector Spaces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:04:37.521728Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.07831"},"observation_digest":"sha256:7e1f34b8cfae366a6326f9a3a4275acb1010abfa044079fc83c3ae20af2bbeee","observation_id":"ee3f5c68-3595-42c2-95cf-a2be8e62329c","resolution":{"observed_at":"2026-08-16T05:04:37.521728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-07T15:36:05.737732Z","title":"Mas- sive activations in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14638","last_updated":"2025-05-20T17:26:12Z","snapshot_observed_at":"2026-08-15T10:44:48.060817Z","submitted_at":"2025-05-20T17:26:12Z","title":"Dual Precision Quantization for Efficient and Accurate Deep Neural Networks Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:05.737732Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.14638"},"observation_digest":"sha256:cf69c18ddeefa8204a5700a6177e734e8357775f75d93a3def7d9dde8981cb11","observation_id":"6f2c8c5c-774a-4a46-9200-b00f149dacea","resolution":{"observed_at":"2026-08-07T15:36:05.737732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-07T14:45:28.759191Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17812","last_updated":"2025-05-23T12:29:00Z","snapshot_observed_at":"2026-08-19T10:15:10.249589Z","submitted_at":"2025-05-23T12:29:00Z","title":"Seeing It or Not? Interpretable Vision-aware Latent Steering to Mitigate Object Hallucinations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:28.759191Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.17812"},"observation_digest":"sha256:b52cfb6c0148ab6588f6fdc4da169b8dd36e6983eed2c20f835d959a1191543d","observation_id":"bb0f94bf-7c2a-4275-9518-11fbd28bcacf","resolution":{"observed_at":"2026-08-07T14:45:28.759191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-07T14:20:25.968312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-14T04:43:53.465410Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.968312Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:bdc2707be02b9249803e603f43fd5232b2558d066c88744a1dff0b0ac56ed4c0","observation_id":"e8bbd1dc-631f-4ba0-bba4-95b283e3cd07","resolution":{"observed_at":"2026-08-07T14:20:25.968312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-15T20:36:55.342354Z","title":", Chen, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20305","last_updated":"2025-05-18T17:30:10Z","snapshot_observed_at":"2026-08-23T09:05:27.926234Z","submitted_at":"2025-05-18T17:30:10Z","title":"Making Sense of the Unsensible: Reflection, Survey, and Challenges for XAI in Large Language Models Toward Human-Centered AI","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:36:55.342354Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.20305"},"observation_digest":"sha256:e56e6c5f3d6c63f724837aff2bae158b30350c0a732f6d4b6d178999fde1bfb3","observation_id":"0146fe6b-aa47-49dd-86b2-f7f12d72334e","resolution":{"observed_at":"2026-08-15T20:36:55.342354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-07T13:30:40.241455Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21670","last_updated":"2025-05-27T18:48:40Z","snapshot_observed_at":"2026-08-20T11:17:21.005663Z","submitted_at":"2025-05-27T18:48:40Z","title":"Rethinking the Outlier Distribution in Large Language Models: An In-depth Study","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:40.241455Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.21670"},"observation_digest":"sha256:732b1f135ff83016c610c680ae0a06987bb50de78da7ce1ddafa3ad1278c4831","observation_id":"51c67f3b-c46e-4aa9-80f0-31229390a4ca","resolution":{"observed_at":"2026-08-07T13:30:40.241455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-07T10:43:43.694378Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04985","last_updated":"2026-07-08T07:56:27Z","snapshot_observed_at":"2026-08-19T02:08:39.348290Z","submitted_at":"2025-06-05T12:56:12Z","title":"FPTQuant: Function-Preserving Transforms for LLM Quantization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:43.694378Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2506.04985"},"observation_digest":"sha256:6da9f511cdf9b02ec9065a3e5cb4d63136d20a87e4eb507eb284cae6cdf7c1ba","observation_id":"dbc63c28-99f4-47d7-b4b6-d19a1ba1c380","resolution":{"observed_at":"2026-08-07T10:43:43.694378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-15T18:37:59.050314Z","title":"Z.; and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19651","last_updated":"2025-07-29T07:51:37Z","snapshot_observed_at":"2026-08-19T16:38:18.168185Z","submitted_at":"2025-06-24T14:14:52Z","title":"PEVLM: Parallel Encoding for Vision-Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T18:37:59.050314Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2506.19651"},"observation_digest":"sha256:4412220cc13c6cb49459d8e0851132a346f85f56604d9d89e8a6dbcf8c0eb67e","observation_id":"a8cfbe6d-2231-4c8b-8721-906e352e75b4","resolution":{"observed_at":"2026-08-15T18:37:59.050314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-15T18:36:04.236333Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19697","last_updated":"2025-06-24T15:03:57Z","snapshot_observed_at":"2026-08-22T17:16:28.332687Z","submitted_at":"2025-06-24T15:03:57Z","title":"Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T18:36:04.236333Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2506.19697"},"observation_digest":"sha256:ab5cd864f14afe7d1a3039cdc57371accbafe0717ce726cb4a2d665fc09a8f07","observation_id":"2e1d3a8a-d15c-409d-bba9-fc01f777ec28","resolution":{"observed_at":"2026-08-15T18:36:04.236333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-06T22:47:52.279011Z","title":"Z., and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20752","last_updated":"2025-06-25T18:25:08Z","snapshot_observed_at":"2026-08-20T15:41:28.901367Z","submitted_at":"2025-06-25T18:25:08Z","title":"Characterization and Mitigation of Training Instabilities in Microscaling Formats","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:47:52.279011Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2506.20752"},"observation_digest":"sha256:bee1dfb0655d51817f25273022ebe36a5eabfd5d503f7e2984d48cf6135775ec","observation_id":"a9597c0d-7cd2-468a-9765-fd31b87c8fbe","resolution":{"observed_at":"2026-08-06T22:47:52.279011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-06T17:47:40.342861Z","title":"Massive activations in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-20T23:44:49.241075Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.342861Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:178c31565284c6f37aaf720a12b99dcb2d14db00805df61dd09cd340beae5d4c","observation_id":"328b74aa-c4eb-4829-b374-fc4130bcb1e3","resolution":{"observed_at":"2026-08-06T17:47:40.342861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-06T15:24:49.076209Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-18T02:14:38.362036Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.076209Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:0c712aa66a082c52926aaf3bd0d9b5175fe0c349952816646925588c74603e33","observation_id":"ac939149-f285-4c96-b1e9-8d3269bf9ef8","resolution":{"observed_at":"2026-08-06T15:24:49.076209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-06T12:21:25.673273Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21959","last_updated":"2025-07-29T16:09:15Z","snapshot_observed_at":"2026-08-19T16:30:05.822991Z","submitted_at":"2025-07-29T16:09:15Z","title":"Mitigating Spurious Correlations in Weakly Supervised Semantic Segmentation via Cross-architecture Consistency Regularization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:21:25.673273Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2507.21959"},"observation_digest":"sha256:c3eb6b488ef9619efe8d3890c34d265e63e856b874462364736a1f0b5da051e1","observation_id":"127db34a-44aa-44c1-9ba1-042b06b07865","resolution":{"observed_at":"2026-08-06T12:21:25.673273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-06T00:03:56.368022Z","title":"Shao, W.; Chen, M.; Zhang, Z.; Xu, P.; Zhao, L.; Li, Z.; Zhang, K.; Gao, P.; Qiao, Y .; and Luo, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04404","last_updated":"2025-08-21T13:26:14Z","snapshot_observed_at":"2026-08-19T16:15:59.233043Z","submitted_at":"2025-08-06T12:46:03Z","title":"Discriminating Distal Ischemic Stroke from Seizure-Induced Stroke Mimics Using Dynamic Susceptibility Contrast MRI","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:56.368022Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2508.04404"},"observation_digest":"sha256:314ab701f2cf74d7207a3a0f27edc56e196c2b3d5544618c3cc7d4177ad49650","observation_id":"a4a28053-910a-4330-9e3e-a3bb82c42a71","resolution":{"observed_at":"2026-08-06T00:03:56.368022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T12:32:13.895867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01535","last_updated":"2025-09-09T04:01:50Z","snapshot_observed_at":"2026-08-20T08:32:42.453898Z","submitted_at":"2025-09-01T15:13:15Z","title":"CAT: Causal Attention Tuning For Injecting Fine-grained Causal Knowledge into Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T12:32:13.895867Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2509.01535"},"observation_digest":"sha256:95f45362db536065be94945a08f2ca83a5287451f60133d4a8c3228bd9b1c41e","observation_id":"0ef4d47a-fef7-4492-9b73-f80f95bab925","resolution":{"observed_at":"2026-08-05T12:32:13.895867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2509.21677","last_updated":"2026-05-08T19:10:32Z","snapshot_observed_at":"2026-08-06T13:56:12.160481Z","submitted_at":"2025-09-25T22:50:03Z","title":"Prophecy: Inferring Formal Properties from Neuron Activations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T13:31:04.425374Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2509.21677"},"observation_digest":"sha256:b791f82845ff7af6ec8b9587f349e4ed2b14f9b690b61ec4e7150f6fb5a84bab","observation_id":"74c8d797-2c9b-4f86-b5a7-7b1ba4d2cee5","resolution":{"observed_at":"2026-05-18T13:31:24.705418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2511.22681","last_updated":"2026-04-27T15:41:55Z","snapshot_observed_at":"2026-08-15T00:56:57.686832Z","submitted_at":"2025-11-27T18:30:19Z","title":"CacheTrap: Unveiling a Stealthier Gray-Box Trojan against LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T04:13:13.231293Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2511.22681"},"observation_digest":"sha256:3cffed9e5fe3ceadef118886102d3ff0b0700342cec2efc0da1593ae775d8dbe","observation_id":"cba88781-4174-4f78-8112-203773de3080","resolution":{"observed_at":"2026-05-17T04:14:00.183201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-21T17:10:37.279303Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T11:33:32.568261Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2601.02780"},"observation_digest":"sha256:c0b2f59569018dc2b22de19f3c0346e4870a93a91eed8eeb137c2601ecc784ff","observation_id":"11853ee6-3d40-4068-ac60-7334cef886f2","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-03T11:16:00.419063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07036","last_updated":"2026-06-02T22:18:21Z","snapshot_observed_at":"2026-08-17T17:44:09.641049Z","submitted_at":"2026-01-11T19:19:39Z","title":"Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T11:16:00.419063Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2601.07036"},"observation_digest":"sha256:5c10d40ee2e41d7c32dfc2508ceb55f787de79f4a52bf19795f7c00df6b43a06","observation_id":"7ff386ff-d10b-413c-842a-21c3972864b8","resolution":{"observed_at":"2026-08-03T11:16:00.419063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-08-16T20:33:34.399636Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":291,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:46dbaca6eefb4f54f29cb328ba3cfb8ee33f4acbb1f3d3019ff74637a6db202b","observation_id":"3020cc14-71ed-4415-8184-1da2152ecdd9","resolution":{"observed_at":"2026-05-16T12:40:54.708987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:98e960c6dc1f441915e29daa4ade0fab58cff7da9229c4dccd703f59616bf253","observation_id":"ffc5e7d6-2ead-4d3b-9349-b6a1fc54ba35","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-07-13T23:28:12.790404Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16867","last_updated":"2026-06-03T09:37:20Z","snapshot_observed_at":"2026-08-14T22:25:11.633208Z","submitted_at":"2026-03-17T17:59:51Z","title":"Efficient Reasoning on the Edge","version":2},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-07-13T23:28:12.790404Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2603.16867"},"observation_digest":"sha256:76e0837df4686f51c0c0cbc8fa8044bec7fe6128be2ec535aae634ef4352b347","observation_id":"e7f4d679-9ca7-453f-ba8c-a03d7c8ba61f","resolution":{"observed_at":"2026-07-13T23:28:12.790404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2604.03316","last_updated":"2026-07-26T08:57:51Z","snapshot_observed_at":"2026-08-15T12:52:26.617085Z","submitted_at":"2026-04-01T09:59:09Z","title":"When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T23:20:51.899127Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.03316"},"observation_digest":"sha256:dfde64dbd0e0d0470a1935b97bf5807f2d082ac3566e7e6bcc56fb5951f2c5f8","observation_id":"62b6b7d8-2d88-4b30-a58a-3d7207d95271","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-02T17:04:24.797847Z","title":"arXiv preprint arXiv:2402.17762 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03316","last_updated":"2026-07-26T08:57:51Z","snapshot_observed_at":"2026-08-15T12:52:26.617085Z","submitted_at":"2026-04-01T09:59:09Z","title":"When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T17:04:24.797847Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.03316"},"observation_digest":"sha256:147de9bc94a73b4d63efcc5427ce0236c23160fdd6a74430f73640ba28b3a37b","observation_id":"6dee6136-6b0a-4d77-b30f-d58da2d1b15a","resolution":{"observed_at":"2026-08-02T17:04:24.797847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2604.03380","last_updated":"2026-05-02T22:39:40Z","snapshot_observed_at":"2026-08-14T20:10:29.267068Z","submitted_at":"2026-04-03T18:19:18Z","title":"Noise Steering for Controlled Text Generation: Improving Diversity and Reading-Level Fidelity in Arabic Educational Story Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T19:39:07.039348Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.03380"},"observation_digest":"sha256:a361c419b9b3f6e6ee04fd83c1b6ea42c701486c6e9da030642a1d8e0739697b","observation_id":"c80a1876-0fdb-4220-b322-79369b779401","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2604.12782","last_updated":"2026-04-14T14:17:59Z","snapshot_observed_at":"2026-08-11T18:44:28.415280Z","submitted_at":"2026-04-14T14:17:59Z","title":"OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:15:59.622461Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.12782"},"observation_digest":"sha256:45bc361af2191d71c530627e42694a7dc74207b8312fc6e91a4db27184824c71","observation_id":"f49cec62-35b2-4572-bea6-adc1f4d780ae","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2604.16983","last_updated":"2026-04-18T12:55:28Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T12:55:28Z","title":"Graph-Guided Adaptive Channel Elimination for KV Cache Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T07:06:08.786535Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.16983"},"observation_digest":"sha256:88377ca3063d1514ed773c0c585fab77ee1b6438141d4349583c2a82922a5529","observation_id":"b1dc4a5b-5ac9-4a65-81c5-c0d9c08aab5e","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2604.17789","last_updated":"2026-04-21T07:37:48Z","snapshot_observed_at":"2026-08-14T23:57:22.966176Z","submitted_at":"2026-04-20T04:27:28Z","title":"DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T05:59:23.738476Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.17789"},"observation_digest":"sha256:3a169260e18c050c17d04d3796765019f4b596f5357fc7d80cc0c162501cbe4d","observation_id":"83b3ef74-a5a2-466f-b0c2-4c4937fa1a99","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2604.20937","last_updated":"2026-06-19T12:00:35Z","snapshot_observed_at":"2026-08-11T20:05:20.361661Z","submitted_at":"2026-04-22T13:28:53Z","title":"Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T00:43:44.921189Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.20937"},"observation_digest":"sha256:b767d915123d6e96896d7dd7a1b569f2e0a201854f3c3681b6ad61bc524a6660","observation_id":"95e5c181-0bb2-476c-87e6-8d1b341ab6f0","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2604.24162","last_updated":"2026-04-27T08:18:30Z","snapshot_observed_at":"2026-08-12T23:07:46.836882Z","submitted_at":"2026-04-27T08:18:30Z","title":"Defusing the Trigger: Plug-and-Play Defense for Backdoored LLMs via Tail-Risk Intrinsic Geometric Smoothing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T03:09:43.879809Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2604.24162"},"observation_digest":"sha256:44b4e87654bb70b90d22c1610aea9b4c88f9f0d82f54a86da02d8d7f41a4f8ed","observation_id":"2dd3e400-3304-40f7-b222-803c265efc7a","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.01330","last_updated":"2026-05-02T08:49:51Z","snapshot_observed_at":"2026-08-13T12:39:53.174087Z","submitted_at":"2026-05-02T08:49:51Z","title":"Colinearity Decay: Training Quantization-Friendly ViTs with Outlier Decay","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T14:24:54.946996Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.01330"},"observation_digest":"sha256:1875355132bc8c6ac48bba0ffe3fd077bed7a99c8cfd4baca74fc85181693196","observation_id":"55732636-5021-41b6-9195-eab9969b97c2","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.05206","last_updated":"2026-05-06T17:59:42Z","snapshot_observed_at":"2026-08-15T01:12:10.163798Z","submitted_at":"2026-05-06T17:59:42Z","title":"Taming Outlier Tokens in Diffusion Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T17:20:16.402422Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.05206"},"observation_digest":"sha256:09531c4e629f7c5a4ab777be3fce6751d81b04ac99dce8142d4596ea02db4448","observation_id":"9b70fc32-94e4-4282-b233-b2fae0127f2d","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.05741","last_updated":"2026-05-07T06:32:57Z","snapshot_observed_at":"2026-08-17T19:38:48.914653Z","submitted_at":"2026-05-07T06:32:57Z","title":"HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T11:38:49.630171Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.05741"},"observation_digest":"sha256:202bc2d75c52a3b4ab468f15b1772ffaa1daae3a54fa0054d499810615299a4e","observation_id":"d6009a94-3323-4e32-b7bd-c6b32bf871cc","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.08504","last_updated":"2026-05-12T18:33:07Z","snapshot_observed_at":"2026-08-15T07:10:24.839341Z","submitted_at":"2026-05-08T21:37:27Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T02:29:20.796512Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.08504"},"observation_digest":"sha256:e34dd5bbe066bd8bdb7fde9cc2dcc1afa5c656802e6cf880a9128db1fecc4d35","observation_id":"3cfaea57-1004-4290-98c1-8905cd8367e0","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.08504","last_updated":"2026-05-12T18:33:07Z","snapshot_observed_at":"2026-08-15T07:10:24.839341Z","submitted_at":"2026-05-08T21:37:27Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T21:03:25.624300Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.08504"},"observation_digest":"sha256:034e66c4d66272e62ac41d631a9eabf6412a5a2f999c8e73ec4569e39c6870c3","observation_id":"ae2b1b10-7ccd-43af-b80f-0655ff6f4e04","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-08T23:21:56.577406Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:18:26.883899Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:90d7ebaf012bbb8fdf5e6fb4f164d76605b64796a6ffad33c19894699ee174c5","observation_id":"922095c1-efa6-420a-a1c3-694242266ca4","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-08T23:21:56.577406Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:59:16.233848Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:41ce088b24eb5688422c2ef969348c3213a2273e0282bfabf7399c5892e99129","observation_id":"cb3946b7-ea77-4c40-9bbb-e6d4d25819e1","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-08T23:21:56.577406Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:11.360530Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:aa11a918fdaca0e2823175adb5a5c3e7f8f8b1c9455bce5f08dfbc1fcccc3326","observation_id":"ceba6819-4be6-47be-b841-f47b7fbf3bcf","resolution":{"observed_at":"2026-07-01T13:45:46.094318Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.10622","last_updated":"2026-05-11T14:16:25Z","snapshot_observed_at":"2026-08-17T15:07:11.268566Z","submitted_at":"2026-05-11T14:16:25Z","title":"Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-12T05:15:34.156717Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.10622"},"observation_digest":"sha256:aee00ddde77112ef5163ffd27df53db99284c3a4b1e1f9873b172b7eb681404c","observation_id":"ea74b8f5-9e0e-4191-8a50-34700be059a3","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.16147","last_updated":"2026-07-06T18:29:27Z","snapshot_observed_at":"2026-08-23T15:19:57.889297Z","submitted_at":"2026-05-15T16:27:10Z","title":"Registers Matter for Pixel-Space Diffusion Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T19:08:23.052621Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.16147"},"observation_digest":"sha256:f2ec1cb651fb56723cdf372f3d3e1d655ad038b390dc0be04a15441448516bb9","observation_id":"3c9d3649-708d-45a2-b29f-a57bcd5c25e4","resolution":{"observed_at":"2026-05-20T19:08:54.075715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.18832","last_updated":"2026-05-12T22:22:15Z","snapshot_observed_at":"2026-08-11T23:54:00.085816Z","submitted_at":"2026-05-12T22:22:15Z","title":"Precision Tracked Transformer via Kalman Filtering, Kriging and Process Noise","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-20T21:44:58.434589Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.18832"},"observation_digest":"sha256:e5ac26c8b49c3d82d9f023c67643be628f4e7bcf93c5b16272e727aeb820f0bb","observation_id":"80abfa05-8b46-4a34-94b2-b50624b91b6d","resolution":{"observed_at":"2026-05-20T21:49:05.404901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.18898","last_updated":"2026-05-17T11:00:59Z","snapshot_observed_at":"2026-08-16T14:02:09.548885Z","submitted_at":"2026-05-17T11:00:59Z","title":"A Two-Parameter Weibull Framework for Diagnosing Transformer Weight Distributions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-20T14:20:15.499338Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.18898"},"observation_digest":"sha256:35680e9a2bf110da8a683253feff1d9e66941d911c4f74dc14f88fcf899b1e7e","observation_id":"e08a1f29-2709-4f9f-bf97-79d48ac48c83","resolution":{"observed_at":"2026-05-20T14:23:21.552672Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.19622","last_updated":"2026-05-19T10:00:14Z","snapshot_observed_at":"2026-08-16T20:48:56.505261Z","submitted_at":"2026-05-19T10:00:14Z","title":"UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T06:48:00.733211Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.19622"},"observation_digest":"sha256:759f8f2e60aecad1305d91dfdb3887d653bea28bc45525fe5c6d6d1f68adaa3c","observation_id":"f08fd51c-3415-4236-a430-80a793d5822d","resolution":{"observed_at":"2026-05-20T06:48:05.658978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-15T05:49:17.926349Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:fecb1b7744a9bcf5675cd9ab826aeba298dba1dca80185947734031ee66b09e6","observation_id":"394692bc-6410-4042-a7aa-acc161029fe6","resolution":{"observed_at":"2026-05-20T07:58:07.583961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.23040","last_updated":"2026-05-21T21:13:14Z","snapshot_observed_at":"2026-08-19T07:16:42.923325Z","submitted_at":"2026-05-21T21:13:14Z","title":"Steered Generation via Gradient-Based Optimization on Sparse Query Features","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-25T05:31:29.510639Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.23040"},"observation_digest":"sha256:94898f5b921a242221e205355fab712e33ed4bfbe14b0f2f3418e10918822e14","observation_id":"44d160ba-f95a-4d6e-bfb4-cbcc6e847c31","resolution":{"observed_at":"2026-05-25T05:36:40.308302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.23258","last_updated":"2026-05-22T06:00:15Z","snapshot_observed_at":"2026-08-19T08:36:21.490928Z","submitted_at":"2026-05-22T06:00:15Z","title":"A Simple Plug-in for Improving Eviction-Based KV Cache Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T04:51:04.068354Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.23258"},"observation_digest":"sha256:1279ebf23ee9c9a8c61cb37b8fb54c99ec73ce071fdce8d23ff29049a0f0832c","observation_id":"27532da8-eaba-4e7b-b0c6-7be961a8d607","resolution":{"observed_at":"2026-05-25T04:55:24.127620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.23259","last_updated":"2026-05-22T06:00:39Z","snapshot_observed_at":"2026-08-18T20:31:29.182245Z","submitted_at":"2026-05-22T06:00:39Z","title":"Multi-Gate Residuals","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-25T04:48:06.164938Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.23259"},"observation_digest":"sha256:1f3617b7a5297ebe77792543d3cfb49d8bf57eb5a280dc72128a3969c45da367","observation_id":"5a9ecc30-18ea-4fd4-93e1-ef7e3d804773","resolution":{"observed_at":"2026-05-25T04:50:20.372266Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.31429","last_updated":"2026-05-29T15:23:39Z","snapshot_observed_at":"2026-08-13T03:44:35.816618Z","submitted_at":"2026-05-29T15:23:39Z","title":"YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T23:19:18.264462Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.31429"},"observation_digest":"sha256:b37743f9011bcceca57a388f2813b34942a9a4d33903d1aa4bcfb2ca63368a47","observation_id":"09f478f2-335a-4ce6-80da-eb1f509e88f4","resolution":{"observed_at":"2026-06-28T23:22:46.925024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.03465","last_updated":"2026-06-02T10:45:21Z","snapshot_observed_at":"2026-08-12T23:20:29.892505Z","submitted_at":"2026-06-02T10:45:21Z","title":"Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T11:31:25.851340Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.03465"},"observation_digest":"sha256:ba7632d0cac20817e220e6a86308bcd37c6525cc0f25b006e8b9611132b13c59","observation_id":"18d3ee7d-4d24-41b5-af02-b14fbeb4c824","resolution":{"observed_at":"2026-07-02T01:46:26.869250Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.03712","last_updated":"2026-06-02T14:34:01Z","snapshot_observed_at":"2026-08-15T05:11:09.542126Z","submitted_at":"2026-06-02T14:34:01Z","title":"When Graph Tokens Sink: A Mechanistic Analysis of Graph Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T11:27:09.779776Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.03712"},"observation_digest":"sha256:9f073fffbca717b4c36a88c281f2103b67cc1c9b73e697986c0ceed13950c478","observation_id":"94ed6142-bd48-4a66-8ca7-1bb3d67694f2","resolution":{"observed_at":"2026-07-02T01:56:27.444608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.05516","last_updated":"2026-06-03T23:42:09Z","snapshot_observed_at":"2026-08-13T18:32:37.465305Z","submitted_at":"2026-06-03T23:42:09Z","title":"Dominant-Layer ZO: A Single Layer Dominates Zeroth-Order Fine-Tuning of LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T06:35:46.175065Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.05516"},"observation_digest":"sha256:b7e985c6304162c82a8d706e4d702e5bba39565b4841a14574fd72b144c4d7d5","observation_id":"6a09064c-2530-4d0f-ae0e-1305d741deac","resolution":{"observed_at":"2026-07-02T07:56:46.987673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.05957","last_updated":"2026-06-04T09:54:08Z","snapshot_observed_at":"2026-08-14T05:17:37.167621Z","submitted_at":"2026-06-04T09:54:08Z","title":"Dead Directions: Geometric Singular Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T03:20:09.365073Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.05957"},"observation_digest":"sha256:3953c16f5e9753372b7bdea45b2c72b191775927fc8d5c4f7d540d3c669d299f","observation_id":"ab8c87e8-10b9-4d2b-a08b-368bcd703a83","resolution":{"observed_at":"2026-07-02T11:36:55.209040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.06521","last_updated":"2026-06-02T17:29:15Z","snapshot_observed_at":"2026-08-04T10:14:33.744124Z","submitted_at":"2026-06-02T17:29:15Z","title":"P-Cast Precision in FP8 Attention: Sink-Induced Collapse and the Optimality of S=2^8","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T07:55:23.257970Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.06521"},"observation_digest":"sha256:fdfdebbbef4757b57b9617482b23b5f44334ba50828cc288444ea2851bea3656","observation_id":"c3a4e679-9f32-4593-819f-9832b2a8718b","resolution":{"observed_at":"2026-07-02T05:56:40.586160Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:f23123092da18f5dcab6ab984a73807a4eb590bda72fbd75625ab8a9fa451d24","observation_id":"02f250f4-fe71-41c5-8299-34fea20461bb","resolution":{"observed_at":"2026-06-28T23:32:46.731937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:02d3067f0c8979e1832533b9247ab3b508a0d2bd80690c1d899777ab2de23b37","observation_id":"51a33f4e-b687-467c-8c08-3ba3eebdd8ca","resolution":{"observed_at":"2026-06-28T23:32:47.298617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-16T04:02:37.667711Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:b230fbf6d7821ea944c61c6ee04b826a1f6a5d79b86a4572b8a4d7d5511e68d7","observation_id":"5d824933-ff7a-4041-842b-d0eaf2b5bec4","resolution":{"observed_at":"2026-07-03T01:57:32.370082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.11722","last_updated":"2026-06-10T06:53:58Z","snapshot_observed_at":"2026-08-13T03:25:55.208169Z","submitted_at":"2026-06-10T06:53:58Z","title":"ICA Lens: Interpreting Language Models Without Training Another Dictionary","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:58.878499Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.11722"},"observation_digest":"sha256:29814253e5020745bf7d920bb13c9b8d9fc6a061b8f10db63b272ed310bdd92e","observation_id":"172cd7cd-07e9-484b-8f53-863739c41580","resolution":{"observed_at":"2026-07-03T09:17:49.067937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.12412","last_updated":"2026-06-10T17:59:57Z","snapshot_observed_at":"2026-08-03T05:45:43.148184Z","submitted_at":"2026-06-10T17:59:57Z","title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:24.118536Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.12412"},"observation_digest":"sha256:ada415a08fd5d7fe05e210289ef3918b8c26bbbf8a42ea474fd9c3acb1677a14","observation_id":"2e7efc17-490e-4eca-a6db-881506a87601","resolution":{"observed_at":"2026-07-03T11:28:04.157411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.12487","last_updated":"2026-06-10T09:25:45Z","snapshot_observed_at":"2026-08-13T07:02:18.498766Z","submitted_at":"2026-06-10T09:25:45Z","title":"DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T10:36:33.893923Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.12487"},"observation_digest":"sha256:eb973eea99496a676401eb3039853275e25848891ac03e7b5d109b7f1e359938","observation_id":"762dfa80-5f30-456e-a465-a0ac29fb917e","resolution":{"observed_at":"2026-07-03T08:57:47.899068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-13T11:59:50.629136Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T06:29:46.190303Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.13392"},"observation_digest":"sha256:518381b66025d00a8b55751ad2e7f09f5db2eebf1202055707810f46f122c94c","observation_id":"a4d8e077-dc61-44be-a07e-303fd8770aca","resolution":{"observed_at":"2026-07-03T15:28:34.115353Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.18673","last_updated":"2026-06-17T04:20:00Z","snapshot_observed_at":"2026-08-12T18:25:33.741270Z","submitted_at":"2026-06-17T04:20:00Z","title":"Understanding and Mitigating Prompt Leaking Attacks in Real-World LLM-Based Applications","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T20:47:36.337189Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.18673"},"observation_digest":"sha256:f53f2631080a7a5776cda0aaed7e9dfa72d415cb37637026bc3373b81af45787","observation_id":"f5782f62-4696-4b0c-b7ce-bd0696b564f7","resolution":{"observed_at":"2026-07-04T00:59:20.670950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.19491","last_updated":"2026-06-17T18:28:37Z","snapshot_observed_at":"2026-08-15T21:04:56.399941Z","submitted_at":"2026-06-17T18:28:37Z","title":"Algebraic Dead Directions in LayerNorm Transformers: A Forward-Pass-Only Diagnostic at LLM Scale","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:11.815522Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.19491"},"observation_digest":"sha256:d71a4e76a3707b23f6209ba57dae0708d79311a5edaf5ea5b8b95f7839b4eb33","observation_id":"d2115d05-ec7e-42a5-b466-24f950eb2ad8","resolution":{"observed_at":"2026-07-04T00:29:15.257781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.20743","last_updated":"2026-06-17T20:30:55Z","snapshot_observed_at":"2026-08-12T17:04:34.023305Z","submitted_at":"2026-06-17T20:30:55Z","title":"Massive Activations Are Architecturally Robust: A Controlled Scratch/Commitment Residual Stream Test","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T20:47:54.133087Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.20743"},"observation_digest":"sha256:d4358391e5c8d62a9a11d4f2d3b76874f5dd156e1a69bbf6b7676a04d36b16ef","observation_id":"16a81b1e-96f9-4708-948f-ae046188af58","resolution":{"observed_at":"2026-07-04T00:59:20.553890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.21023","last_updated":"2026-06-19T01:21:10Z","snapshot_observed_at":"2026-08-13T01:46:34.753063Z","submitted_at":"2026-06-19T01:21:10Z","title":"Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:58:55.680525Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.21023"},"observation_digest":"sha256:dc06fda6734876ce1dc8934bffce5deb4c2d4c1a4ae2a29502084e4ae303a795","observation_id":"cb690365-a9ba-4e4a-bfc6-16a759ba42a4","resolution":{"observed_at":"2026-07-04T05:59:38.000608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2606.26587","last_updated":"2026-06-25T04:19:04Z","snapshot_observed_at":"2026-08-17T15:55:33.333568Z","submitted_at":"2026-06-25T04:19:04Z","title":"SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T05:41:39.052865Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2606.26587"},"observation_digest":"sha256:3a09d422754febeaf28ae5ca9ea9e690515e606ae89d773c3d123c1cb2f81d1e","observation_id":"46bd5bef-62cc-4abc-848b-9ef34ed5d7e1","resolution":{"observed_at":"2026-07-04T12:59:52.345822Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2607.00434","last_updated":"2026-07-01T04:45:41Z","snapshot_observed_at":"2026-08-08T21:41:10.025868Z","submitted_at":"2026-07-01T04:45:41Z","title":"Information-Regularized Attention for Visual-Centric Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T15:12:43.475802Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.00434"},"observation_digest":"sha256:9e1e4f2f6f79b6fd2cca8d2fa7a1e9edf60dcf52e37614219e20c048befbd842","observation_id":"b028e290-b7d9-4a7b-bcc9-987a888f41fd","resolution":{"observed_at":"2026-07-02T15:17:07.253514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-07-12T05:46:45.293902Z","title":"Massive activations in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02968","last_updated":"2026-07-03T05:21:46Z","snapshot_observed_at":"2026-08-16T15:16:10.440947Z","submitted_at":"2026-07-03T05:21:46Z","title":"Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T05:46:45.293902Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.02968"},"observation_digest":"sha256:95af551e3a8ecaca781ede67de7a60e94455447a65576e08a7a188e4985eb653","observation_id":"4d21c1c0-3162-443d-9e09-7db8d820e31f","resolution":{"observed_at":"2026-07-12T05:46:45.293902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2607.07670","last_updated":"2026-07-08T17:24:43Z","snapshot_observed_at":"2026-08-19T04:45:27.255531Z","submitted_at":"2026-07-08T17:24:43Z","title":"Does Bielik Know What It Doesn't Know? Activation Dispersion Separates Entity Familiarity from Factual Reliability Across Model Scale","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-10T18:22:48.495407Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.07670"},"observation_digest":"sha256:8e8b6641834663656cc84f6472fba10794bf719b4d4c68f2bbe6aa71d9979327","observation_id":"e5ab7a8d-73d7-4e49-a1f5-600ae34915e1","resolution":{"observed_at":"2026-07-10T18:27:31.317526Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-07-13T04:11:56.715045Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09279","last_updated":"2026-07-10T10:48:14Z","snapshot_observed_at":"2026-08-13T22:05:20.574752Z","submitted_at":"2026-07-10T10:48:14Z","title":"Transient Reserves, Sink Dampers, and the Failure of Eigenvalue Reasoning in the Attention Propagator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T04:11:56.715045Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.09279"},"observation_digest":"sha256:9c4e5381827fc747aaff4e18c01bc85e3cdcf304c82c63b819b55289590c0646","observation_id":"70a0c0dc-55c0-4f0d-b0c4-7fe95e173d1c","resolution":{"observed_at":"2026-07-13T04:11:56.715045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-07-14T14:15:46.074413Z","title":"arXiv preprint arXiv:2402.17762 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09967","last_updated":"2026-07-14T07:41:52Z","snapshot_observed_at":"2026-08-17T23:02:08.447207Z","submitted_at":"2026-07-10T20:48:10Z","title":"Learning in Curved Weight Space:Exponential-Linear Weight Reparameterization for Improved Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T14:15:46.074413Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.09967"},"observation_digest":"sha256:7d427a99f8a4dfd819d8306cc96572dfb72d88df99ff7060934995beb993e122","observation_id":"1c206bbc-5ba5-4cdc-b4de-c344a95c3fc6","resolution":{"observed_at":"2026-07-14T14:15:46.074413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-02T04:52:40.524880Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13568","last_updated":"2026-07-15T08:06:59Z","snapshot_observed_at":"2026-08-14T11:04:34.183607Z","submitted_at":"2026-07-15T08:06:59Z","title":"Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T04:52:40.524880Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.13568"},"observation_digest":"sha256:837f97efe352cc8e8a506a8dff1f2734b12f23c6d134bee21170e49b0ae340b7","observation_id":"dbaf008b-e25d-4a52-ae7d-8becdb250a27","resolution":{"observed_at":"2026-08-02T04:52:40.524880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-15T15:39:38.536822Z","title":"Massive activations in large language models.arXiv preprint arXiv:2402.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17822","last_updated":"2026-07-20T11:10:51Z","snapshot_observed_at":"2026-08-19T07:00:59.163891Z","submitted_at":"2026-07-20T11:10:51Z","title":"Phasor Attention: Mean Root Square Normalization for Phase Manifold Preservation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:39:38.536822Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.17822"},"observation_digest":"sha256:f4d298f2e6da17e3fb174216bae025fb8dcf1ff0fe4510710dd49baed4fb624a","observation_id":"d6794ba7-bd94-4812-94aa-56d7ae62c82a","resolution":{"observed_at":"2026-08-15T15:39:38.536822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-01T15:26:28.124965Z","title":"Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18454","last_updated":"2026-07-20T19:07:43Z","snapshot_observed_at":"2026-08-20T07:59:07.886303Z","submitted_at":"2026-07-20T19:07:43Z","title":"Estimating Rare Events in Language Models with Proper Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T15:26:28.124965Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.18454"},"observation_digest":"sha256:8479d8a4ee239af37cd661e25edcaaea551b33efac9d8be073a5eb366aa77399","observation_id":"4a443176-c429-41cb-85b5-64995baa358c","resolution":{"observed_at":"2026-08-01T15:26:28.124965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-01T13:25:57.390684Z","title":"Massive activations in large language models.arXiv preprint arXiv:2402.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19139","last_updated":"2026-07-30T16:07:04Z","snapshot_observed_at":"2026-08-21T20:52:42.138319Z","submitted_at":"2026-07-21T14:29:59Z","title":"Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T13:25:57.390684Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.19139"},"observation_digest":"sha256:6b4f6a4298f051b9fa084db9e8b28161607c2a52f525f5ec9972ab28381e33f0","observation_id":"f39f12d3-f021-4699-939d-3efa67c21e5e","resolution":{"observed_at":"2026-08-01T13:25:57.390684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-02T12:35:17.430243Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22570","last_updated":"2026-06-01T17:20:16Z","snapshot_observed_at":"2026-08-19T19:36:28.079636Z","submitted_at":"2026-06-01T17:20:16Z","title":"Reference Feature Atlases for Mechanistic Auditing of Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T12:35:17.430243Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.22570"},"observation_digest":"sha256:db2f24001ca4b282d989aba2d815394badc7a3d3cc67b10cbcadd96a16992e8a","observation_id":"6459f884-0819-411f-a870-8fb057a89af0","resolution":{"observed_at":"2026-08-02T12:35:17.430243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-03T00:43:52.070083Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28699","last_updated":"2026-08-16T15:41:57Z","snapshot_observed_at":"2026-08-20T23:12:42.345292Z","submitted_at":"2026-07-30T11:04:45Z","title":"WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T00:43:52.070083Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2607.28699"},"observation_digest":"sha256:294b50461227cf915d05f7cc524aca5ddfdfd90626b2805442cd4877cc4fe824","observation_id":"4374f278-588b-48ab-808a-386da25b46e2","resolution":{"observed_at":"2026-08-03T00:43:52.070083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-08T00:50:44.582319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04048","last_updated":"2026-08-04T08:32:05Z","snapshot_observed_at":"2026-08-17T20:44:55.549143Z","submitted_at":"2026-08-04T08:32:05Z","title":"Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:44.582319Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2608.04048"},"observation_digest":"sha256:3060539ee0cb0ca1f3b685294c0302fc5bdbc4f918ddb5d11ce6f3482291102e","observation_id":"f8ff366e-1770-45e8-ac9e-fe0d045b1de9","resolution":{"observed_at":"2026-08-08T00:50:44.582319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-14T04:40:10.034226Z","title":"arXiv preprint arXiv:2402.17762 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08447","last_updated":"2026-08-09T03:30:14Z","snapshot_observed_at":"2026-08-17T06:02:48.187688Z","submitted_at":"2026-08-09T03:30:14Z","title":"Hidden Language Consistency Phenomena in Reasoning LLMs","version":1},"reference_index":210,"source":"arxiv_source","source_observed_at":"2026-08-14T04:40:10.034226Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2608.08447"},"observation_digest":"sha256:83aee0d68e047691a1f72a68641e746daf0ec5caabff0624ec84e92315b8292c","observation_id":"8096263e-d7c3-4f93-8069-42b2d96aabc1","resolution":{"observed_at":"2026-08-14T04:40:10.034226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.17762/citation-record","integrity":"/paper/2402.17762/integrity","json":"/paper/2402.17762/citation-record.json","paper":"/paper/2402.17762"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2207.04901","last_updated":"2022-11-14T12:21:27Z","snapshot_observed_at":"2026-08-20T17:06:31.128595Z","submitted_at":"2022-07-11T14:24:38Z","title":"Exploring Length Generalization in Large Language Models","version":2},"cited_work":{"arxiv_id":"2207.04901","doi":"10.48550/arxiv.2207.04901","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.04901","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring length generalization in large language models","venue":"arXiv (Cornell University)","work_id":"2c9271b4-93c3-4ef2-953e-9d6b8a9c41c0","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2207.04901","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:5a9a44fc43bdc4e70861e7e314de4538daa24e7d34666e0473beaa96a14d064d","observation_id":"bf7665b4-72b0-475b-945a-bff163c79dc9","resolution":{"observed_at":"2026-05-16T07:02:53.818893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational complexity: a modern approach","venue":null,"work_id":"03206498-04bf-40ab-82ce-6bec266dc024","year":2009},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:4a1bee3f27ee6b182620a9a6e682c5756970f34012dd4a74b73f8007ec4a1c6d","observation_id":"37f480b5-0480-42a1-b37a-6e38239fffa5","resolution":{"observed_at":"2026-05-16T07:02:54.081423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05826","last_updated":"2022-10-14T20:06:54Z","snapshot_observed_at":"2026-08-16T17:21:54.868979Z","submitted_at":"2022-02-11T18:43:28Z","title":"End-to-end Algorithm Synthesis with Recurrent Networks: Logical Extrapolation Without Overthinking","version":3},"cited_work":{"arxiv_id":"2202.05826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.05826","snapshot_observed_at":"2026-06-30T07:34:21.669288Z","title":"End-to-end algorithm synthesis with recurrent networks: Logical extrapolation without overthinking","venue":null,"work_id":"25bc4b88-d8d5-459f-a6ee-3871f05ce731","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2202.05826","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:c8097252584d2061b87c251b067a944fc6db098d53d91ccf05122834db928a0e","observation_id":"03c6b057-00e2-4fc8-9c27-4221672679bc","resolution":{"observed_at":"2026-05-16T07:02:53.822887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.08799","last_updated":"2023-01-15T21:53:00Z","snapshot_observed_at":"2026-08-16T16:45:04.685885Z","submitted_at":"2022-07-18T17:55:05Z","title":"Hidden Progress in Deep Learning: SGD Learns Parities Near the Computational Limit","version":3},"cited_work":{"arxiv_id":"2207.08799","doi":"10.48550/arxiv.2207.08799","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.08799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Information Processing Systems , year =","venue":"arXiv (Cornell University)","work_id":"92192172-5c98-475d-ab81-1f83e1a2d120","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2207.08799","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:9142902a2aa86d907e15568ec457cef40d92ab846e0ff8fcabe230f296503d8a","observation_id":"2aaa1d0a-f51b-4518-b377-c470626ae7eb","resolution":{"observed_at":"2026-05-16T07:02:53.826534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mix Barrington","venue":null,"work_id":"9e91a5eb-4082-4686-b17a-c95c104f0867","year":1986},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:4d3048a0643b5c8ab5d5a1135ec9629315b9adabcb700c360067d733b65f8566","observation_id":"0f19f603-6130-40d2-99df-198aea02f32b","resolution":{"observed_at":"2026-05-16T07:02:54.087857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mix Barrington and Denis Thérien","venue":null,"work_id":"e93a09ce-c786-4d8d-be64-992d57c7aba9","year":1988},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:1b6e2ef9fffb027ac3cc78b27623a56213cac7a2995f68695e76231f028d5cf7","observation_id":"a93deff3-640e-4f57-b521-d1f692cdba26","resolution":{"observed_at":"2026-05-16T07:02:54.089754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the ability and limitations of transformers to recognize formal languages","venue":null,"work_id":"83714978-02a0-4583-a033-9c4fea69d022","year":2020},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:345fe13ec070d3456f85de9418fb732dd28aa69aa880a17c605a0e88a24ffde3","observation_id":"283eca06-15f0-40e0-8499-fda607fdc194","resolution":{"observed_at":"2026-05-16T07:02:54.091861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13478","last_updated":"2021-05-02T16:16:03Z","snapshot_observed_at":"2026-08-12T23:06:05.148534Z","submitted_at":"2021-04-27T21:09:51Z","title":"Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges","version":2},"cited_work":{"arxiv_id":"2104.13478","doi":"10.48550/arxiv.2104.13478","metadata_source":"pith","pith_arxiv_id":"2104.13478","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges","venue":"cs.LG","work_id":"5e909969-dcfb-40f6-9099-241ea6f18350","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2104.13478","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:c42d8b66f9c5954ebb264f7c405e8fd3ae723597d2a9959654b7ed1955a2a221","observation_id":"0c657333-c417-484d-ac96-250f846e1ef2","resolution":{"observed_at":"2026-05-16T07:02:53.829983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unbounded fan-in circuits and associative functions","venue":null,"work_id":"f54e7f43-9e1f-4961-919b-189fd85809a4","year":1983},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:7601c68e4fb83f352c9e73b65eac20bbcfba946c2231edaf58c69ff2e9070698","observation_id":"c55341c7-b0cc-47f5-8a5d-7ef88b3854bb","resolution":{"observed_at":"2026-05-16T07:02:54.096303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"4cb5e0dc-e80c-4681-ba2f-14de3137c4a3","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:5e471053cdf098d8eb7fda163d0d05533126b5d1ff2866d3b739d5f84d178281","observation_id":"bfcd1834-5c72-4e04-a434-ce9dd23258e6","resolution":{"observed_at":"2026-05-16T07:02:54.098393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:ad3e5b688438e90fd89a5d3309ec843052bdf7509c89aeab28ffde91e724e882","observation_id":"aa7b790d-53b2-4273-8abe-1a9e95f6fe11","resolution":{"observed_at":"2026-05-16T07:02:53.833214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-automaton aperiodicity is PSPACE -complete","venue":null,"work_id":"45fe8182-c977-4261-9453-a6ad61c37fff","year":1991},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:f5d6ad7408055625bf031ef296bb006823cdd226f2cd4c9d8c55f1e5cfc46653","observation_id":"c8f06064-a61b-424e-a186-62fbc5164034","resolution":{"observed_at":"2026-05-16T07:02:54.102743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The algebraic theory of context-free languages","venue":null,"work_id":"41eb4ec5-cb0c-482e-8587-4b263205062a","year":1959},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:a96d312207050c48c84e16150eb2132c2e5c8a74c05bcb29b7329c55d6cf001d","observation_id":"9e437545-8606-4bf4-9adc-1faa13903d5d","resolution":{"observed_at":"2026-05-16T07:02:54.104694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-16T18:43:58.639735Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:0616867189f0922bcfcc34249adc707dfcd6a23c67fc82fa8f4df9a86518a835","observation_id":"20bf5ead-4004-41af-b2ca-25e534e3039a","resolution":{"observed_at":"2026-05-16T07:02:53.836536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"320a4ac6-e790-4faa-a4da-6409de7f5f4b","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:47bb74301f404799fb9598afc0b98b612b2e293d7379dcb1f50ab2eaeb21cea3","observation_id":"f851dedd-900e-4e83-a2a1-709204939889","resolution":{"observed_at":"2026-05-16T07:02:54.108357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximation by superpositions of a sigmoidal function","venue":null,"work_id":"567e0d97-ec12-4269-8802-52929f5896ba","year":1989},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:5834ab79a7b1f8c62076dc61224213eeaf23b1cd3288363025406c321019d6ca","observation_id":"24cac180-9e4e-4bee-ac4b-61df7b3946d3","resolution":{"observed_at":"2026-05-16T07:02:54.110385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth separation for neural networks","venue":null,"work_id":"b1e885ef-e775-42c5-a9b2-017f03a01c96","year":2017},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:ec447fd411e63817e3aedb8d1d4134a99b0d88ad055a1164fb97d7970344a675","observation_id":"12758b5f-19f0-4843-bbc3-47b592a800ec","resolution":{"observed_at":"2026-05-16T07:02:54.112303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning parities with neural networks","venue":null,"work_id":"1c247f2c-94fb-4cd8-b204-e5cd94cb7f26","year":2020},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:970368724538001eeb90c0a36880353467e885c06477470dc5434cd5b93ce3f2","observation_id":"5760ebfe-4b0f-4557-8a55-fee9a6865c21","resolution":{"observed_at":"2026-05-16T07:02:54.114180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal transformers","venue":null,"work_id":"1d54a4b4-27a0-4c97-b26b-d97c357aebd1","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:7d2157fa010424bdb059419570652b29a7ec7374a5fcd1341396fafaf9898f80","observation_id":"3dd2a47f-bb65-4b1e-80b2-0a91578c0491","resolution":{"observed_at":"2026-05-16T07:02:54.115941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02098","last_updated":"2023-02-28T13:22:17Z","snapshot_observed_at":"2026-08-20T03:05:50.470476Z","submitted_at":"2022-07-05T15:06:11Z","title":"Neural Networks and the Chomsky Hierarchy","version":3},"cited_work":{"arxiv_id":"2207.02098","doi":"10.48550/arxiv.2207.02098","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.02098","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"International Conference on Learning Representations , month =","venue":"arXiv (Cornell University)","work_id":"1b7f8055-2e20-4d37-b9ab-1748c03c4a1c","year":2023},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2207.02098","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:19c30c4f798dca02bdd9dcc46ea5acbfe32d15f5ea479843578f074760b259cc","observation_id":"9587bdfb-4457-41ac-a217-9877c405cf5a","resolution":{"observed_at":"2026-05-16T07:02:53.839680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:24.12734+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:24.12734+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patti, Jayson Lynch, Avi Shporer, Nakul Verma, Eugene Wu, and Gilbert Strang","venue":null,"work_id":"d5077e07-11d2-4e5e-ab81-8c7606f65fd4","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:c82db7ec907c482fe5df59a3d5d813266b3231401129482b87c752d4392300d3","observation_id":"1438c5d8-e3cb-47f3-9666-1f75af0df165","resolution":{"observed_at":"2026-05-16T07:02:54.119816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can self-attention networks recognize D yck-n languages? In Findings of the Association for Computational Linguistics: EMNLP","venue":null,"work_id":"3cfb9e33-9b9b-4383-a25d-ae5f415fae1b","year":2020},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:c5d63cafaca469d9bc4eb63ef916e02274561475a33a708bbbcca14aa5b44893","observation_id":"a92effb4-23f9-4782-9fba-952d5d7acee8","resolution":{"observed_at":"2026-05-16T07:02:54.121875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inductive biases and variable creation in self-attention mechanisms","venue":null,"work_id":"fcde70d3-6b06-410c-887f-9babbfa4606b","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:f0ba39030658d42ce068ca855945d98e15e7b500750747a5085438f2e043f386","observation_id":"e9d71054-971f-43cd-8c8e-c8e76299aaca","resolution":{"observed_at":"2026-05-16T07:02:54.123803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.06345","last_updated":"2015-08-26T02:02:47Z","snapshot_observed_at":"2026-08-19T16:26:21.492239Z","submitted_at":"2015-08-26T02:02:47Z","title":"Computational Holonomy Decomposition of Transformation Semigroups","version":1},"cited_work":{"arxiv_id":"1508.06345","doi":null,"metadata_source":"pith","pith_arxiv_id":"1508.06345","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational Holonomy Decomposition of Transformation Semigroups","venue":"math.GR","work_id":"f31ce8fc-41d5-4ef6-a6e7-d834050a7dc9","year":2015},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1508.06345","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:d49090a6d15d88bc436bf300d912b66e3b4d428ee2cb09c168072cb940a4fa9a","observation_id":"585d67d4-f497-4b16-9b8e-0013a444403c","resolution":{"observed_at":"2026-05-16T07:02:53.842805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automata, languages, and machines","venue":null,"work_id":"b174be04-e9ba-48a7-a1d1-d0c522aa321c","year":1974},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:976b5181b5916841f3c737722dfb46b037c95535648659901e9f347633db494f","observation_id":"b054a14d-3746-4d23-a476-43ba27cb5b7e","resolution":{"observed_at":"2026-05-16T07:02:54.127815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The power of depth for feedforward neural networks","venue":null,"work_id":"75c610ad-ba81-4cae-aa92-81b5ff06f94f","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:b023db412eb8cc3c8c6b937c2e9a4833f99dcd67184cb3b443c82e1459e57373","observation_id":"3c77fa33-cbbf-43de-9e27-e19eb874af7a","resolution":{"observed_at":"2026-05-16T07:02:54.130003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":"c5eea371-bed6-4e13-beed-e76e37665927","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:f629a3a6317d38b94ab90a60df4d904cd2c750d962a2674a34ee867425a53ae3","observation_id":"f9d7f47e-4285-43e0-b52e-33b1c7728c0e","resolution":{"observed_at":"2026-05-16T07:02:54.132652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Saxe, and Michael Sipser","venue":null,"work_id":"17177630-335d-47b3-9cb7-e3f991dadaf8","year":1984},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:3bf62f95058b7b943633a8a5aaaaccbb896af6ad691d4d3e4d8c8ad19bc261b6","observation_id":"a053446c-b77f-4ea0-ad7e-7a608e4877e8","resolution":{"observed_at":"2026-05-16T07:02:54.134628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shortcut learning in deep neural networks","venue":null,"work_id":"39e0273a-a08a-4096-acaa-dda4cf1d2666","year":2020},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:6084e09e3d98038f0da7c1cc2217fe86fc1bc3fcd8139af77f20630fa5c3340c","observation_id":"233d2411-6057-4706-b4b1-bc989a61be87","resolution":{"observed_at":"2026-05-16T07:02:54.137666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13196","last_updated":"2023-01-30T18:57:31Z","snapshot_observed_at":"2026-08-16T15:59:03.055969Z","submitted_at":"2023-01-30T18:57:31Z","title":"Looped Transformers as Programmable Computers","version":1},"cited_work":{"arxiv_id":"2301.13196","doi":"10.48550/arxiv.2301.13196","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.13196","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Papailiopoulos, Dimitris , year =","venue":"arXiv (Cornell University)","work_id":"f145d48d-6da0-4a3a-945b-dc1551f01aff","year":2023},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2301.13196","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:514742dc5eba454bfaec663ae122d06d1b17ae9040f043a8b6cd7a67e85b1b29","observation_id":"e81aff0e-10ba-4a11-a325-4f2807ad109b","resolution":{"observed_at":"2026-05-16T07:02:53.846090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reliably learning the R e LU in polynomial time","venue":null,"work_id":"41902f6d-d010-4fbe-8736-1f30d8ba90e8","year":2017},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:cd7f83a3969896564982db81f8040a388a8b70f8dc721dc2e47fc3aa210f49fe","observation_id":"c302ae6d-b427-43a3-af3c-1aadcee5c87f","resolution":{"observed_at":"2026-05-16T07:02:54.146224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-19T09:41:48.169666Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":"1603.08983","doi":"10.48550/arxiv.1603.08983","metadata_source":"pith","pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive Computation Time for Recurrent Neural Networks","venue":"cs.NE","work_id":"75565443-173e-479c-b0e7-d2464e7630be","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:7d376bc6117605408c06272228e459608b22cbae44a646586240fb563ce35a62","observation_id":"8c69106f-3e51-4e1c-ae02-abd60c37a366","resolution":{"observed_at":"2026-05-16T07:02:53.849372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-12T12:07:42.706444Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":"1410.5401","doi":"10.48550/arxiv.1410.5401","metadata_source":"pith","pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Turing Machines","venue":"cs.NE","work_id":"0a5ce53c-9670-42b9-8be5-386de7eed50c","year":2014},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:5a9d40f6dc4c2d128970b7402eee277178fbc71585dff43f69537931781d5c42","observation_id":"cf40a2ef-ccda-41ad-a4f0-50d4fc44a1c9","resolution":{"observed_at":"2026-05-16T07:02:53.852409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:19:27.735387+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:19:27.735387+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02281","last_updated":"2018-03-09T03:37:52Z","snapshot_observed_at":"2026-08-23T21:03:19.652442Z","submitted_at":"2017-11-07T04:42:48Z","title":"Non-Autoregressive Neural Machine Translation","version":2},"cited_work":{"arxiv_id":"1711.02281","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.02281","snapshot_observed_at":"2026-07-09T11:56:12.266880Z","title":"Non-Autoregressive Neural Machine Translation","venue":"cs.CL","work_id":"d98b5510-3b58-4b81-bbb7-f846ef78e061","year":2017},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1711.02281","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:a7cfd9ede8e848c6de46d58f763159e2a828b543ac91099ea5ca32f42a0ef7fa","observation_id":"68d22231-dbe0-49a6-89f7-56ece1c3ee35","resolution":{"observed_at":"2026-05-16T07:02:53.855519Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-20T13:32:55.916408Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:3272deca808bb82a76c14956fbdceaeb88157ec036204e340413d2178a298a72","observation_id":"127c3f46-08d3-411f-8224-66699687de2f","resolution":{"observed_at":"2026-05-16T07:02:53.858762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoretical limitations of self-attention in neural sequence models","venue":null,"work_id":"386a6b8e-50da-43ae-b2e9-b68a5a9051de","year":2020},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:1a8bcc486ba0ad60c3066084180943bcaa80a5a33186614c5e1a14740765ae55","observation_id":"7a56b030-39cc-4fea-ab80-80276c58a064","resolution":{"observed_at":"2026-05-16T07:02:54.158633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-18T14:31:01.734070Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:377664c0057fa3f21364daf31c19359da53930630be9f1988d2ff7b87c4455f9","observation_id":"653efb2c-3ef8-4d44-b276-5311aa9a4380","resolution":{"observed_at":"2026-05-16T07:02:53.862054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"2f1466a3-368c-4a7f-8df8-cf653a6b80df","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:64bfbb06363f133b53d24f34806e18c6b7fbd9d84dd81adf5da18302b41917ef","observation_id":"74df9dd5-5ddd-4e7d-8d12-57ef312aad7a","resolution":{"observed_at":"2026-05-16T07:02:54.181422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards lower bounds on the depth of R e LU neural networks","venue":null,"work_id":"a65aff5f-8c03-4caf-8f25-26c0deed468b","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:b1587392327a947f8bbe270f2c849e965e2b2a133e99428303c290da3ba803df","observation_id":"04632b0f-3c44-4673-9256-cd26b6f18a59","resolution":{"observed_at":"2026-05-16T07:02:54.184891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Steele Jr","venue":null,"work_id":"b6d34865-7691-4a7e-b6f8-eb58cf94f1d6","year":1986},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:fb8d5dbf123be4fdba7307c6676eda6bd5284816d6b1387b066acb4e25832ce8","observation_id":"e1e15af2-b2fb-41a1-8fb0-2ddd27a60ec8","resolution":{"observed_at":"2026-05-16T07:02:54.187933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":"aa642680-a6f3-483b-bed9-45884e996a2b","year":1989},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:6ccd961728d8d862af02bd69c17d210185275bd94dedef7a1bec5327f816984e","observation_id":"47e79d1b-50f8-485b-a623-06a975162c1d","resolution":{"observed_at":"2026-05-16T07:02:54.191135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-14T19:54:00.470999Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":"1801.06146","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-07-04T07:39:38.353471Z","title":"Universal Language Model Fine-tuning for Text Classification","venue":"cs.CL","work_id":"9990d84d-84b4-4fd4-acb5-da451524d2f4","year":2018},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:8f4736376e4ea812dd8fd31297cc4454fefb9c5e43fc8f40e220c287f47c846c","observation_id":"96fb3a48-c9fa-48c0-8c27-01efe73efd82","resolution":{"observed_at":"2026-05-16T07:02:53.865528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07852","last_updated":"2022-11-02T00:35:56Z","snapshot_observed_at":"2026-08-16T17:15:11.316643Z","submitted_at":"2022-03-11T23:44:33Z","title":"Block-Recurrent Transformers","version":3},"cited_work":{"arxiv_id":"2203.07852","doi":"10.48550/arxiv.2203.07852","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.07852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Block-recurrent transformers","venue":"arXiv (Cornell University)","work_id":"f544759a-b43c-4e29-b23c-aefa040cfc87","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2203.07852","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:dc54f871ee50eb42c020d7ad089a921b4716924aa089fa904cdd49a9646d22a6","observation_id":"68e668c7-e742-40bc-b1f2-6369c30a19c3","resolution":{"observed_at":"2026-05-16T07:02:53.868612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":"21c91e83-478b-484a-8582-a659089ede21","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:5d643e040d82a37d4f19c6b0dd29703498ded3a0d95af64ed46d883d85216d2c","observation_id":"76e8e6fe-dfd2-497f-aa61-85680fe996a3","resolution":{"observed_at":"2026-05-16T07:02:54.200656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13076","last_updated":"2021-09-20T06:45:09Z","snapshot_observed_at":"2026-08-16T18:36:43.295670Z","submitted_at":"2021-03-24T10:50:43Z","title":"Finetuning Pretrained Transformers into RNNs","version":2},"cited_work":{"arxiv_id":"2103.13076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.13076","snapshot_observed_at":"2026-07-02T12:26:56.591321Z","title":"Kasai, J., Peng, H., Zhang, Y ., Yogatama, D., Ilharco, G., Pappas, N., Mao, Y ., Chen, W., and Smith, N","venue":null,"work_id":"49478719-4473-4291-85cc-280561e12c70","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2103.13076","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:0e1fe4e662967122e3ea7d4e7c7dbba47ef7c97f1fbcafbcefd4b9f38c26c317","observation_id":"db9ec858-602d-451c-9fa5-9eeb85bb7ab9","resolution":{"observed_at":"2026-05-16T07:02:53.871604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15595","last_updated":"2021-03-15T07:56:22Z","snapshot_observed_at":"2026-08-10T13:04:19.097027Z","submitted_at":"2020-06-28T13:11:02Z","title":"Rethinking Positional Encoding in Language Pre-training","version":4},"cited_work":{"arxiv_id":"2006.15595","doi":"10.48550/arxiv.2006.15595","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.15595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2006.15595 (2020)","venue":"arXiv (Cornell University)","work_id":"dd27322a-5ad7-4011-9816-8aa4c2e936d0","year":2006},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2006.15595","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:a828a5aa3a13b2e7e5995b6e0fd1756be8a56d9d632dc399b985f280d6462086","observation_id":"3a7f9b6d-e7bb-42ed-84d1-7cf952c15b8a","resolution":{"observed_at":"2026-05-16T07:02:53.874934Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The number of semigroups of order n","venue":null,"work_id":"8db66077-a501-40c8-b1c7-46c8e06d778a","year":1976},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:6cefe2969a8d8c65e08b09e99808a0f564150973819582ea01c679329b13b509","observation_id":"c7d13e69-2620-49e1-a2fe-d5a3176b760e","resolution":{"observed_at":"2026-05-16T07:02:54.209735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite permutation groups with large abelian quotients","venue":null,"work_id":"e23f3772-b954-4760-85d7-f2196a6d7917","year":1989},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:36165af93536f1acc51d79c012d50d9b53e07fca47ba1c3064d6035dc91c7744","observation_id":"dbde73a0-d7f7-456d-b251-9bd3520677a7","resolution":{"observed_at":"2026-05-16T07:02:54.213125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Produit complet des groupes de permutations et probleme d’extension de groupes II","venue":null,"work_id":"4cdcb8b7-55d0-46f7-a277-87625147ec09","year":1951},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:32d25f92454de9783e7465fbda6d617b63b922dbd5fe958247766084eaa0fed6","observation_id":"6b88597f-d4af-4ca5-945d-44bbbca1878d","resolution":{"observed_at":"2026-05-16T07:02:54.216542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Algebraic theory of machines, I : P rime decomposition theorem for finite semigroups and machines","venue":null,"work_id":"41f00a62-f805-4b32-91ef-2a5a791b129b","year":1965},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:45d50f7013bf0d3ff8584167f9aa53650c9a304b4cce6a6a7554fe26c19e6df1","observation_id":"59756881-3cb6-4eeb-bdf4-42e54e602ae0","resolution":{"observed_at":"2026-05-16T07:02:54.219974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01412","last_updated":"2019-12-02T15:05:24Z","snapshot_observed_at":"2026-08-14T09:46:05.632888Z","submitted_at":"2019-12-02T15:05:24Z","title":"Deep Learning for Symbolic Mathematics","version":1},"cited_work":{"arxiv_id":"1912.01412","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.01412","snapshot_observed_at":"2026-07-02T20:47:22.644628Z","title":"Lample and F","venue":null,"work_id":"31fd8fbd-1ae7-44ff-aafe-6b60ab1872b3","year":1912},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1912.01412","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:680981cfd0396bd91ee6299a0d0580f5d860c301ccdf152664b688df82191faf","observation_id":"e5a57c1f-6aa7-4811-9b0c-a7a2fa2bccab","resolution":{"observed_at":"2026-05-16T07:02:53.877938Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07648","last_updated":"2017-05-26T18:53:56Z","snapshot_observed_at":"2026-08-20T15:18:13.100635Z","submitted_at":"2016-05-24T20:28:53Z","title":"FractalNet: Ultra-Deep Neural Networks without Residuals","version":4},"cited_work":{"arxiv_id":"1605.07648","doi":null,"metadata_source":"pith","pith_arxiv_id":"1605.07648","snapshot_observed_at":"2026-07-10T20:17:33.749623Z","title":"FractalNet: Ultra-Deep Neural Networks without Residuals","venue":"cs.CV","work_id":"ecf74c2e-7eed-4017-8f0b-f90686110609","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1605.07648","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:b841204d7b0056da805f753ac15731d7a4fea860ceee93f93d0ad5f4334ffe1a","observation_id":"b8f8724a-2a4f-438c-84cc-792030f1fa64","resolution":{"observed_at":"2026-05-16T07:02:53.880895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the ability of neural nets to express distributions","venue":null,"work_id":"cb4e872c-8980-44a6-99fa-c87d8d83f8d8","year":2017},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:30cab5ef32c98a3b19d31bf9cec93c5fa4a34d66e1d007e4cc052a0e5f78287b","observation_id":"d17ad449-261b-4f31-82de-492cb1bfac53","resolution":{"observed_at":"2026-05-16T07:02:54.230282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-08-15T05:41:03.327624Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":"2203.07814","doi":"10.48550/arxiv.2203.07814","metadata_source":"pith","pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Competition-Level Code Generation with AlphaCode","venue":"cs.PL","work_id":"00d9ab4d-e694-4677-8132-332873a8f9a7","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:fade8a9c0fcb849dbff44ad9115c3590c8cf625acf3edf02f8bb6121f97dbe78","observation_id":"3576dd43-7ecb-4202-8aff-56b9e07acc0d","resolution":{"observed_at":"2026-05-18T06:43:48.088484Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:34.328608+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:34.328608+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:af706e36888fa0d79d3174948ad549c3a173587182cf9f97108383e6cc87959d","observation_id":"faf9b645-badb-4687-901e-ea787e9f8423","resolution":{"observed_at":"2026-05-16T07:02:53.887986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the K rohn- R hodes cascaded decomposition theorem","venue":null,"work_id":"f8e394f7-eb6d-4795-9db0-0b6861146d71","year":2010},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:838924329fee6a9e614acc5ad5ed8fcb8b6d61de0e310abddcfe3e0aa745927b","observation_id":"5485814b-ba2f-4b17-b144-ae447a2d7e27","resolution":{"observed_at":"2026-05-16T07:02:54.239532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the cascaded decomposition of automata, its complexity and its application to logic ( D raft)","venue":null,"work_id":"2d7e52e4-cc13-46e3-af36-b44ef5f95062","year":1994},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:7c2193a626200935c4bf9affc321fc6a1c3f9a8bdd7aa09eaf20383f257e5aec","observation_id":"b007f765-2385-4b31-acc8-14c145a6d39d","resolution":{"observed_at":"2026-05-16T07:02:54.242291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Threshold circuits for iterated matrix product and powering","venue":null,"work_id":"2400d4ff-87f5-4029-9a92-afd4eb284ef6","year":2000},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:6fbf97031730646dae6a01f1196aadcfb976eed9e7e801bdabf018dc5d135305","observation_id":"31dce5d4-1a0d-4c37-b2fe-367d9443d2f6","resolution":{"observed_at":"2026-05-16T07:02:54.245277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.16213","last_updated":"2022-04-11T00:55:14Z","snapshot_observed_at":"2026-08-22T01:45:34.241573Z","submitted_at":"2021-06-30T17:09:47Z","title":"Saturated Transformers are Constant-Depth Threshold Circuits","version":3},"cited_work":{"arxiv_id":"2106.16213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.16213","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9837332-7e6d-4686-a5b7-52f419456500","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2106.16213","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:57381a45bcb3f64e689721171193f0a2775b41ccd716d105f02da8c81e781a2e","observation_id":"46f67443-bc99-49d0-9490-7fc1ac0ea102","resolution":{"observed_at":"2026-05-16T07:02:53.891005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00588","last_updated":"2023-03-01T09:21:14Z","snapshot_observed_at":"2026-08-16T16:35:19.827758Z","submitted_at":"2022-09-01T17:03:07Z","title":"Transformers are Sample-Efficient World Models","version":2},"cited_work":{"arxiv_id":"2209.00588","doi":"10.48550/arxiv.2209.00588","metadata_source":"arxiv_reference","pith_arxiv_id":"2209.00588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transform- ers are sample-efficient world models.arXiv preprint arXiv:2209.00588","venue":"arXiv (Cornell University)","work_id":"388af2ed-cc43-48cc-92be-9fba2c20d9e3","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2209.00588","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:a20c9b2d46ac9965f25b0422d9161b1e40f092da5da957ec2f80d8177fc68a68","observation_id":"c4a750c0-6672-4e3c-8023-4b52e399a5d5","resolution":{"observed_at":"2026-05-16T07:02:53.894196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.548557+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.548557+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03073","last_updated":"2017-11-09T02:35:25Z","snapshot_observed_at":"2026-08-14T20:15:36.624367Z","submitted_at":"2017-11-08T18:02:47Z","title":"Lower bounds over Boolean inputs for deep neural networks with ReLU gates","version":2},"cited_work":{"arxiv_id":"1711.03073","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.03073","snapshot_observed_at":"2026-07-03T17:18:43.412824Z","title":"Lower bounds over Boolean inputs for deep neural networks with ReLU gates","venue":"cs.CC","work_id":"7e9a2dd7-dd07-4053-a555-692085f35252","year":2017},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1711.03073","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:35f43a637b48010b8db42936cb8329df1510f3987a76ab8e8d7379cd3ecefe5d","observation_id":"15333cc0-9d04-498e-a6de-c19c7116fe3c","resolution":{"observed_at":"2026-05-16T07:02:53.897343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A mechanistic interpretability analysis of grokking","venue":null,"work_id":"3d2ea4c2-d3e1-4378-b980-975c27aca5c1","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:f38267d33f6fee0b4992ddd8e5f246b3fb6c54e5147fe8090efbd865fc6e4bd1","observation_id":"29ea9dea-ceda-4589-bec7-1f83577a80d0","resolution":{"observed_at":"2026-05-16T07:02:54.256013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9e4c810-3ae5-426b-8b8c-b5a7eb296c6e","year":2020},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:308de10de05f750e3eef7526ac6f10f463de0c34cbdbac34e863fcb9563c88cf","observation_id":"794952e7-ffaa-4cff-a572-5994a2a6b0a1","resolution":{"observed_at":"2026-05-16T07:02:54.258406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03688","last_updated":"2022-11-27T01:23:46Z","snapshot_observed_at":"2026-08-16T16:54:33.900160Z","submitted_at":"2022-06-08T06:06:51Z","title":"Identifying good directions to escape the NTK regime and efficiently learn low-degree plus sparse polynomials","version":2},"cited_work":{"arxiv_id":"2206.03688","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03688","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identifying good directions to escape the NTK regime and efficiently learn low-degree plus sparse polynomials","venue":null,"work_id":"7adaad64-dc99-4a2e-ac6d-8b688fd15723","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2206.03688","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:fd13535aafb0293a8d4d7d41c9a39cfbd867f0c3895263d4b4040539ecd31318","observation_id":"6c66c989-11d2-4082-8819-e90c99765ee8","resolution":{"observed_at":"2026-05-16T07:02:53.900523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.13019","last_updated":"2021-04-12T19:58:27Z","snapshot_observed_at":"2026-08-16T18:42:58.085754Z","submitted_at":"2021-02-25T17:22:53Z","title":"Investigating the Limitations of Transformers with Simple Arithmetic Tasks","version":3},"cited_work":{"arxiv_id":"2102.13019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.13019","snapshot_observed_at":"2026-07-03T21:28:58.031749Z","title":"Investigating the limitations of transformers with simple arithmetic tasks","venue":null,"work_id":"39cc5a0c-b5b9-4767-8c63-504421c8523a","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2102.13019","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:698c0694922706888c02f35dd9c1fa88583577d0b525be88597bc51a7a359a8f","observation_id":"efcc52a1-63a1-4fb6-8cf7-19a34046c046","resolution":{"observed_at":"2026-05-16T07:02:53.903787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":"2112.00114","doi":"10.48550/arxiv.2112.00114","metadata_source":"pith","pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","venue":"cs.LG","work_id":"a05b1e60-8e76-4f26-9bea-28927a5f8620","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:7b1d5b036b67ca0f697ff535966259db814e30e1e597cf7124954a80ccc76f95","observation_id":"23fb748d-b973-4201-b7e2-abcd1725ceee","resolution":{"observed_at":"2026-05-16T07:02:53.906902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:23.975867+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:23.975867+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The complexity of M arkov decision processes","venue":null,"work_id":"1ee9666f-ff12-4375-ad4d-cd85ae21585a","year":1987},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:ce2ec3f5895816e11e6e1996c34dfe8b075ab541fe9e2c2ad18c02b6283dce99","observation_id":"919bd7a7-9e06-4204-bfb6-2675656d8e5d","resolution":{"observed_at":"2026-05-16T07:02:54.267563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Py T orch: An imperative style, high-performance deep learning library","venue":null,"work_id":"a4238cfb-b133-4eda-bb22-565fb7635131","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:2d862bb8d4b302ab4bbc899f831652e8925d23516e3e08128c1510056935f7fc","observation_id":"ce8c7133-1e27-47e1-9a13-3036070ed7b5","resolution":{"observed_at":"2026-05-16T07:02:54.270094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is turing complete","venue":null,"work_id":"91d7dc7f-0834-4ddf-bac4-e19e6a456439","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:d181252dec025725ce9d855502b6cae6cb2553cfa48f4e93a5364a17cdc248f3","observation_id":"22a9f215-6e25-4c69-8d0c-ad6e8d24b5b9","resolution":{"observed_at":"2026-05-16T07:02:54.272370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05365","last_updated":"2018-03-22T21:59:40Z","snapshot_observed_at":"2026-08-14T19:45:43.957260Z","submitted_at":"2018-02-15T00:05:11Z","title":"Deep contextualized word representations","version":2},"cited_work":{"arxiv_id":"1802.05365","doi":"10.48550/arxiv.1802.05365","metadata_source":"pith","pith_arxiv_id":"1802.05365","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Deep contextualized word representations","venue":"cs.CL","work_id":"dd973cba-647d-49d3-9d24-061b637bb0cd","year":2018},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1802.05365","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:61bb48ace4af150f7789a97e671b4e16ff3f0a543442bda5784da0b33ca2de8c","observation_id":"b66351a4-83ca-44e6-9307-ccbce2b6a2c7","resolution":{"observed_at":"2026-05-16T07:02:53.910338Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03393","last_updated":"2020-09-07T19:50:10Z","snapshot_observed_at":"2026-08-18T11:16:18.404679Z","submitted_at":"2020-09-07T19:50:10Z","title":"Generative Language Modeling for Automated Theorem Proving","version":1},"cited_work":{"arxiv_id":"2009.03393","doi":"10.48550/arxiv.2009.03393","metadata_source":"pith","pith_arxiv_id":"2009.03393","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative Language Modeling for Automated Theorem Proving","venue":"cs.LG","work_id":"73e4b095-67c3-4dfa-bd2f-ac77de3e125f","year":2020},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2009.03393","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:63bea8581f7b2695ba90b601fb452f933a291e0c2c14a6df326cbfe091903e48","observation_id":"9bec790d-b069-45cc-93ed-ef94672a6338","resolution":{"observed_at":"2026-05-23T05:18:10.906922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T06:24:06.618072+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T06:24:06.618072+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":"f9168f1b-319e-434c-8fda-ba116730ab79","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:4cfbc224ac18e574f6e8e7ba276d956a18cb616c6545c00d745d75612cda863e","observation_id":"ed3a336f-a298-430f-9e4a-681e03d47ff8","resolution":{"observed_at":"2026-05-16T07:02:54.281823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"0d746fe1-e644-4ce6-b160-a71af4ffb435","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:0965179f3408f892f84d8b516d8528ff058863aa14e471c6142d008de53765e7","observation_id":"daed02a6-0f65-43b5-a264-a14fb8bf4b36","resolution":{"observed_at":"2026-05-16T07:02:54.283909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reif and Stephen R","venue":null,"work_id":"38d734ca-7b35-414b-abc2-b56e64b462f0","year":1992},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:68f2ae3e9ca8a1dcc94e46fc1af2cd11bfa68d650152b5447c90f350ea18dfc0","observation_id":"155f3d6b-cc80-4e4f-99d5-9b797f5a52fc","resolution":{"observed_at":"2026-05-16T07:02:54.286539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Applications of automata theory and algebra: via the mathematical theory of complexity to biology, physics, psychology, philosophy, and games","venue":null,"work_id":"0b01781b-a1bc-4981-8992-42a5e98f54d2","year":2010},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:7351ea3bd3a65453f6157c2081ca5ba1fc6aff94be2bda8fb201537da251c3c9","observation_id":"fd95f318-987b-4d3b-bb37-7cfd3b71e1a8","resolution":{"observed_at":"2026-05-16T07:02:54.288966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can contrastive learning avoid shortcut solutions? Advances in Neural Information Processing Systems","venue":null,"work_id":"52f5ba23-bbd7-4a27-83db-da8926a3e5ab","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:2fef3ff4be9f8363da222d91be4564693dab235af0ec74d1f02205b3b8d16d36","observation_id":"bfd3ffa3-c957-4cf2-b584-4ccace65d90b","resolution":{"observed_at":"2026-05-16T07:02:54.291209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth separations in neural networks: what is actually being separated? In Conference on Learning Theory, pages 2664--2666","venue":null,"work_id":"943df91f-e412-4acc-a5b9-4de56fc05954","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:fd88949ffee4bb597c2337247bde4157abebefe343bd702c56c61ad7e8b94001","observation_id":"6dddc637-081d-4bd6-ae71-da93130e882a","resolution":{"observed_at":"2026-05-16T07:02:54.293406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Programming puzzles","venue":null,"work_id":"c74267d9-2fb6-4bf0-b248-d98034237528","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:718596ce95dfa0964c7bd470296a892064187b8b739a2a6f584e4c18fb3ca807","observation_id":"8e9b267b-53e0-4d96-ad42-5d0d1a8f979b","resolution":{"observed_at":"2026-05-16T07:02:54.295467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On finite monoids having only trivial subgroups","venue":null,"work_id":"d24da1d6-df90-46b0-9b22-e028423af50e","year":1965},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:97ea7224a25b734d0a66543c11ae7045a164c95d24852f3ee7dd2723777f642b","observation_id":"96d86380-8c48-4056-a082-7be0ac86f010","resolution":{"observed_at":"2026-05-16T07:02:54.297634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can you learn an algorithm? generalizing from easy to hard problems with recurrent networks","venue":null,"work_id":"cb0ce138-1dba-45b6-ada1-9f8a1b170c49","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:ba2a9a5787debc6a7fbf44088f84de89c3763a71612373c7daf077feb955a026","observation_id":"e6c89032-ba93-44b7-bf40-f51c2da5b9ce","resolution":{"observed_at":"2026-05-16T07:02:54.076502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the computational power of neural nets","venue":null,"work_id":"fe32f246-32a2-411d-b8e9-dc18c8b9cc26","year":1992},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:b328148bffa4d565db9663c24e55e3cf205aac4dae977498fcd1a512f7af883b","observation_id":"f5ad8215-382b-41ae-b4a3-f8c1a7ef8088","resolution":{"observed_at":"2026-05-16T07:02:54.078726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benefits of depth in neural networks","venue":null,"work_id":"e31f3dad-505a-4ac7-afff-89ffb4d22305","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:faeee444e46787af9a2c448b44254fc606b438c13b383fe53f7755011c57d9f5","observation_id":"fc8285ad-55a1-47c2-8e7e-0b914092f37c","resolution":{"observed_at":"2026-05-16T07:02:54.083609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05950","last_updated":"2019-08-09T15:51:47Z","snapshot_observed_at":"2026-08-20T04:51:51.539700Z","submitted_at":"2019-05-15T05:47:23Z","title":"BERT Rediscovers the Classical NLP Pipeline","version":2},"cited_work":{"arxiv_id":"1905.05950","doi":"10.48550/arxiv.1905.05950","metadata_source":"arxiv_reference","pith_arxiv_id":"1905.05950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1905.05950 , year=","venue":"arXiv (Cornell University)","work_id":"47ec8f99-dad5-484e-bf9c-6fd2871df72b","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1905.05950","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:7132b07b301094b0b73e106a67762c2dc6e2beacac840d1e73c5ccf377a25df4","observation_id":"cf386873-078d-4130-bbdf-4b4f0b19ec21","resolution":{"observed_at":"2026-05-16T07:02:53.916830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:237d8ce80fc0e1faa151f861e4bad0a609a6613f0b3f57433cb00196097afac3","observation_id":"90c7731a-54c6-40fe-b20d-fcd8dadc4053","resolution":{"observed_at":"2026-05-16T07:02:53.919878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.288815+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.288815+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"43dc0a60-8d22-4f0d-896f-1aa83d601b42","year":2017},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:dd8f473f879f91edb15b732007dee610693b96e8c717530af59b9e981a202fda","observation_id":"e4eb709b-3634-4a27-a53b-41b0fba961c9","resolution":{"observed_at":"2026-05-16T07:02:54.100746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hechtman, and Jonathon Shlens","venue":null,"work_id":"d0ef88d7-d145-4e4c-93e9-56d1b52ebd50","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:23da385588692f9c0e66f03e7f11c8239dc31c186ba9349573ffed2c53678a97","observation_id":"6592dcfc-0acb-49cc-aaaf-d1c573cfb465","resolution":{"observed_at":"2026-05-16T07:02:54.106570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02679","last_updated":"2019-04-11T16:00:53Z","snapshot_observed_at":"2026-08-15T15:16:08.993378Z","submitted_at":"2019-04-04T17:32:49Z","title":"Visualizing Attention in Transformer-Based Language Representation Models","version":2},"cited_work":{"arxiv_id":"1904.02679","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.02679","snapshot_observed_at":"2026-07-09T15:06:18.061686Z","title":"Visualizing Attention in Transformer-Based Language Representation Models","venue":"cs.HC","work_id":"fadc1959-d5f1-4c7f-bb62-9f6e6df319a0","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1904.02679","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:01de06cf0ac6a77d9ea9389e7874ae4279a1720930142d6ba50845f0c9dd7ae3","observation_id":"bd94ffee-00a1-43de-ab48-9479bc180edb","resolution":{"observed_at":"2026-05-16T07:02:53.923110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:06f7d920fee4c1dc5185199566d8d9b4a2985cb4edee533b421298f5656cb592","observation_id":"06c1682f-2943-4fdf-9c88-a1c241b5c5a9","resolution":{"observed_at":"2026-05-16T07:02:53.926612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:08:11.779853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:08:11.779853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:9abb95df68cb57e3dc4f1681f3756008c9a3f57b77d8ddf3850c2df19c5cd5b1","observation_id":"ec2f7afa-eb70-4ad6-8534-45b117f270dc","resolution":{"observed_at":"2026-05-16T07:02:53.929799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.194749+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.194749+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking like T ransformers","venue":null,"work_id":"f090f639-c119-4d30-b352-7d175252ff30","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:b5b5bebc0bf1cb3fad542d5d456722fe0eea6618b39a8b688ba2e34fa41c6c8c","observation_id":"5722265a-b603-46c0-a7cc-2bd47d81cc22","resolution":{"observed_at":"2026-05-16T07:02:54.148694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":"1910.03771","doi":"10.48550/arxiv.1910.03771","metadata_source":"pith","pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":"cs.CL","work_id":"9d86da8d-01d3-41af-a0d2-ee14897927a9","year":2019},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:52f1275a07510fd5036a5724ad673a11a1ea2acc90f2a3de1124662eb524ab89","observation_id":"e1b26e7d-8922-46c7-80b0-b7f77f5fe92f","resolution":{"observed_at":"2026-05-16T07:02:53.933024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:38:08.865847+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:38:08.865847+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":"1609.08144","doi":"10.18653/v1/2021.eacl-main.163","metadata_source":"pith","pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","venue":"cs.CL","work_id":"e294e5a1-5dd2-44a0-b348-adbd62fe1916","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:e98b424780568cb0ee6a87365fd0b00de9fca854df6b38cc9cbd68247f989ff9","observation_id":"4cd7e10a-3919-4403-bdf1-9bc8c6bee864","resolution":{"observed_at":"2026-05-16T07:02:53.936699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09269","last_updated":"2023-07-06T07:29:23Z","snapshot_observed_at":"2026-08-20T21:21:49.969341Z","submitted_at":"2022-04-20T07:25:22Z","title":"A Survey on Non-Autoregressive Generation for Neural Machine Translation and Beyond","version":2},"cited_work":{"arxiv_id":"2204.09269","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.09269","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on non-autoregressive generation for neural machine translation and beyond","venue":null,"work_id":"49d473e4-acd3-4bf1-86ad-f3e4e5b20118","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2204.09269","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:20dd3277f8786676c93d37df796aab339c0d4a3b47d579f25a6faf9785212b29","observation_id":"7e01e40b-bf8d-40be-9e15-c29aab96af9b","resolution":{"observed_at":"2026-05-16T07:02:53.940376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11848","last_updated":"2021-03-02T23:05:49Z","snapshot_observed_at":"2026-07-06T09:58:31.944672Z","submitted_at":"2020-09-24T17:48:59Z","title":"How Neural Networks Extrapolate: From Feedforward to Graph Neural Networks","version":5},"cited_work":{"arxiv_id":"2009.11848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.11848","snapshot_observed_at":"2026-06-28T20:12:38.299479Z","title":"How neural networks extrapolate: From feedforward to graph neural networks","venue":null,"work_id":"e99aa0b2-4bf9-4d90-b0f0-8b7a9ee96f7f","year":2009},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2009.11848","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:dd44cfc2e2262544a7067d5c97fe250f1596a95089cc68f8b620802d5e492ec7","observation_id":"3c1b399f-6259-4e54-ab8a-c104186c7f9a","resolution":{"observed_at":"2026-05-16T07:02:53.944970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Papadimitriou, and Karthik Narasimhan","venue":null,"work_id":"ca4ca42c-631c-4b88-b211-2ee001573725","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:302717eb260582f8e9f6163de85e09d448f2c6a49b5b2d0376a19c606a7bf370","observation_id":"e01ed2c6-4416-4824-9291-6aa1e0219a6f","resolution":{"observed_at":"2026-05-16T07:02:54.194251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering atari games with limited data","venue":null,"work_id":"c48d9695-9687-4f1a-958b-8ad12dcfbd86","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:b6723215559709eab0214e8e3c979844da8b80fb3c880dad014cc1fdb973366f","observation_id":"808e24e5-1ade-43bc-8f4e-b2beb6c0c6af","resolution":{"observed_at":"2026-05-16T07:02:54.197478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cascade synthesis of finite-state machines","venue":null,"work_id":"4b73ccfc-9459-48df-84f1-e950c4e6f7eb","year":1967},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:1d942369eebb26d85a0de297a2f9dc9a32898d9db6af7b1d5a767f3d6ed0509f","observation_id":"49649fc0-c2c0-4f38-8b26-6ed9cea981d7","resolution":{"observed_at":"2026-05-16T07:02:54.203741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12580","last_updated":"2022-02-18T21:09:45Z","snapshot_observed_at":"2026-08-16T18:07:19.572910Z","submitted_at":"2021-07-27T03:50:31Z","title":"Pointer Value Retrieval: A new benchmark for understanding the limits of neural network generalization","version":2},"cited_work":{"arxiv_id":"2107.12580","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.12580","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointer value retrieval: A new benchmark for understanding the limits of neural network generalization","venue":null,"work_id":"06d49986-7f6d-4f2c-9bec-202ee3787ca4","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2107.12580","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:f990db2afe255673bf04295155746ee98e97526ef00f4194723d7d15ad3c6980","observation_id":"e2fd5998-2df1-4a8b-8738-4969b2513d5b","resolution":{"observed_at":"2026-05-16T07:02:53.948453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How does mixup help with robustness and generalization? In International Conference on Learning Representations, 2021 b","venue":null,"work_id":"509b7c6d-7ce6-46f5-9557-ed20a04961fc","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:aae043b5a29882ee0d78ac9bbff6d09c7a8f2de2db289d43943ca99ff4f10cf4","observation_id":"693bd688-01ea-445e-b965-5fee4316af7c","resolution":{"observed_at":"2026-05-16T07:02:54.223517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04301","last_updated":"2023-02-17T23:18:30Z","snapshot_observed_at":"2026-08-20T12:07:26.928871Z","submitted_at":"2022-06-09T06:30:17Z","title":"Unveiling Transformers with LEGO: a synthetic reasoning task","version":3},"cited_work":{"arxiv_id":"2206.04301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04301","snapshot_observed_at":"2026-07-01T15:45:48.023940Z","title":"Unveiling T ransformers with LEGO : a synthetic reasoning task","venue":null,"work_id":"bdce0202-9a53-4ec3-be23-ee73b697f9e6","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2206.04301","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:312aad196ebefa198524cb5669fe3159a2b95d6d3c20f0959f22e87274bbfe4e","observation_id":"609d4f79-b35b-426f-80a3-9e7d0721a608","resolution":{"observed_at":"2026-05-16T07:02:53.952149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":2,"verified_exact":30,"verified_fuzzy":57},"total_outbound_references":159},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 100 of 159 outbound references and 100 inbound Pith citation observations for arXiv:2402.17762."}