{"as_of":"2026-08-17T21:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b936106b3d411003c36757f8dc65c9946a326769a4927f292eb62f52a753155a","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:46:12.923935Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07921/citation-record","integrity":"/paper/2608.07921/integrity","json":"/paper/2608.07921/citation-record.json","paper":"/paper/2608.07921"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:12.818591Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.818591Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:d4baa3a2c9fa375772ef3f645a55b35cd5e02100427c36d75cfaba13f98e504b","observation_id":"9571e9c8-936b-4993-a546-b02d2972f964","resolution":{"observed_at":"2026-08-12T00:46:12.818591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.371352Z","title":"A mathematical framework for transformer circuits,","venue":null,"work_id":"7434a58d-26c3-4c17-83dd-2d7fb3865d93","year":2021},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.823516Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:144c3cb13ae10dd041192ffef801decb7863140ff3253597b0c5c7fdad92530c","observation_id":"ffaa6dd1-86fc-4e29-ab75-879b7e201995","resolution":{"observed_at":"2026-08-12T00:46:13.376120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-15T09:43:59.961298Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-12T00:46:12.828334Z","title":"In-context learning and induction heads,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.828334Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:7e27c52467e67c00cb728a1f1a49c49c90bf5f1ef0c02d651e9bd7c5cbbfc857","observation_id":"6df36632-a5b4-4726-b453-4d37bfc58897","resolution":{"observed_at":"2026-08-12T00:46:12.828334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:12.833310Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.833310Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:0fbee9f48e6db739d7eed24c5c7c97b0957e82d2a40e62a083ac4193c424ffe6","observation_id":"1fc4c0f1-1af0-41bc-9330-f0e1bb4c0aa2","resolution":{"observed_at":"2026-08-12T00:46:12.833310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:12.837985Z","title":"Distribution of eigenvalues for some sets of random matrices,","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.837985Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:182b1a76468f5234d08d5ae4cebbb8a981798dd3190db228c7ffaefe575e4f6e","observation_id":"51ae4dc3-e53f-493e-b8cb-487804b38312","resolution":{"observed_at":"2026-08-12T00:46:12.837985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:12.842982Z","title":"Implicit self-regularization in deep neural networks: Evidence from random matrix theory and implications for learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.842982Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:0156f632d211da3d87a9132f32332cdeb566303be656aad6a87d0f517d2b4ac3","observation_id":"bfa875f8-b8f7-456a-aff7-d05b9934f043","resolution":{"observed_at":"2026-08-12T00:46:12.842982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-08-17T09:16:32.835122Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-08-12T00:46:12.847768Z","title":"A spectral condition for feature learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.847768Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:601963b6099b48d1d644e513ca24f837320790ed7185acdc38679533bbdef37f","observation_id":"aa812edd-7087-4962-a5eb-600c48a76158","resolution":{"observed_at":"2026-08-12T00:46:12.847768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.335689Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"8b5ff676-4ce9-4b6d-840d-4f3d03093b7c","year":2019},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.852294Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:8ab44a06ecb93dfd20576ce3d255830d60649f3de112141885e4b31284b4aac6","observation_id":"1aa839ff-5760-4f56-a6eb-fcd09ed7ae0d","resolution":{"observed_at":"2026-08-12T00:46:13.340844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T00:46:12.856561Z","title":"RoBERTa: A robustly optimized BERT pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.856561Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:854d85860517f055a7b2484cfb888b674966fb5c7e668d1fd3fb8fa7bf980ee6","observation_id":"5271e91f-6d3d-4c87-af8d-f5716557cfc1","resolution":{"observed_at":"2026-08-12T00:46:12.856561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T00:46:12.861338Z","title":"OPT: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.861338Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:b7c06a4614e941de1b2947a26e1d5607ec794a9e491a6466ff9078e4563ffe82","observation_id":"d90c9779-4b3a-420e-a4e3-be695088610d","resolution":{"observed_at":"2026-08-12T00:46:12.861338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T00:46:12.866008Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.866008Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:4abccc13f98977d9fb6a47aa67097a336267c004e8928172966e751ab1d39c5a","observation_id":"b706274c-7db4-411a-b38f-b1f4a7f05a81","resolution":{"observed_at":"2026-08-12T00:46:12.866008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T00:46:12.870550Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.870550Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:e4a17d98306fd78c86e6c40668c78ea7677879cad71616b664b3ae4accbc05e3","observation_id":"2413c58a-76d3-405a-8d68-922c590bb004","resolution":{"observed_at":"2026-08-12T00:46:12.870550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T00:46:12.875200Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.875200Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:7fa684b4611488ba6a0d300bd2301dce4ecc8df45fc070f82ee1245125dfa55e","observation_id":"acbdc865-ee55-4dff-9ef1-746a74c985eb","resolution":{"observed_at":"2026-08-12T00:46:12.875200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T00:46:12.880012Z","title":"Mistral 7B,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.880012Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:b6bacaa07fc2a80b638e52b75bda53d7793854120cbc66ff4cc2741c4859eef0","observation_id":"12a788cf-30a9-41a0-9445-0525ed4be4ff","resolution":{"observed_at":"2026-08-12T00:46:12.880012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-12T00:46:12.884531Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.884531Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:f2298a29451112074ef6bc142464bc93334e8d1f1e206b24b0a895eac7613b8f","observation_id":"b9d15885-29bd-4e58-8c34-21e151a7e8e8","resolution":{"observed_at":"2026-08-12T00:46:12.884531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T00:46:12.889024Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.889024Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:1d08e8202eb3afbb76e198c4b7713de7f32c0622b6ec0c2e91a9b3c3f244ab96","observation_id":"0576c148-1bb6-462b-904f-d5484ec6e6a5","resolution":{"observed_at":"2026-08-12T00:46:12.889024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.319692Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints,","venue":null,"work_id":"318162e7-3789-4b96-a321-207bc8525e06","year":2023},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.893597Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:5b9530d964549a57e5cd2885c0abce031b1f6ead15d6983a434846fe65ed15f3","observation_id":"709b51fb-a74c-4622-87fd-795a82554477","resolution":{"observed_at":"2026-08-12T00:46:13.324435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.304297Z","title":"HellaSwag: Can a machine really finish your sentence?,","venue":null,"work_id":"2f44916b-5fb8-4df8-8a16-6a2c389024ad","year":2019},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.897969Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:4c606f4928c283ab290ed5553af9ff18d1a9e6d8f70c4960142b51f915d0a7c5","observation_id":"bb151c8b-b6f2-46c8-8227-f247e94e8f7c","resolution":{"observed_at":"2026-08-12T00:46:13.308951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.289907Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":"5e530d1d-c054-45b9-a685-32178c9f9245","year":2021},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.902307Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:82013e0a74d91f86b5560e5b6ff4cd552e1f1691f2be9d2ea26ac067c4219ed2","observation_id":"7b8fb840-ab0f-45c6-a409-f5c229fc15c2","resolution":{"observed_at":"2026-08-12T00:46:13.294633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.274479Z","title":"PIQA: Reasoning about physical commonsense in natural language,","venue":null,"work_id":"db2bee60-ac34-44da-85d0-1acb80dec0b8","year":2020},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.906552Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:90c17e6aae80194ae6ce4e2bcacbc6184c57f75f0be8197fa6f3620bba1e04a3","observation_id":"677e8a3c-4f5b-49ad-861d-28f79bb569bc","resolution":{"observed_at":"2026-08-12T00:46:13.279462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:12.910787Z","title":"A framework for few-shot language model evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.910787Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:51ad1eadf41b0a90eacdf20f27428c6d8be7ad10b0fe7620d9e768ea50e3cea8","observation_id":"59a8edf4-fac9-45ab-bd2a-b2b9f2a985e5","resolution":{"observed_at":"2026-08-12T00:46:12.910787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.259620Z","title":"What does BERT learn about the structure of language?,","venue":null,"work_id":"92418b3b-a942-484f-b98e-3b8d81733ced","year":2019},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.915395Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:cb9ebc872ab445af53806712d93c1ea6f63ff3a970f60eb1113c942974f5e4e4","observation_id":"5791b5aa-6aaa-4ccc-b43e-cb3b0c46ef0f","resolution":{"observed_at":"2026-08-12T00:46:13.264492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-08-16T21:36:28.067615Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-12T00:46:12.919561Z","title":"Toy models of superposition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.919561Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:5118922dbeb9d724ca0b26175464a0560e9b9e1dd8d23648ca8010c5b0d4c0a5","observation_id":"3b51e1c5-c4c5-4c27-b2a0-d39643dd88ee","resolution":{"observed_at":"2026-08-12T00:46:12.919561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17510","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:46:13.085560Z","title":"LORA-CRAFT: Cross-layer rank adaptation via frozen Tucker decomposition of pre- trained attention weights,","venue":null,"work_id":"251baf78-4011-49a2-850b-89d7ab94cf65","year":2026},"citing_paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:46:12.923935Z"},"links":{"citing_paper":"/paper/2608.07921"},"observation_digest":"sha256:e4d0fddba31eb6881803f7d7f7d77e78385b8c4f3a17a2ad09e9eb868d05120f","observation_id":"0d513932-740e-473f-8f61-a70b76248cae","resolution":{"observed_at":"2026-08-12T00:46:13.094666Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07921","last_updated":"2026-08-08T04:56:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T21:37:19.970912Z","submitted_at":"2026-08-08T04:56:11Z","title":"Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.07921."}