{"as_of":"2026-08-16T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7e01f5c468f51869654bef9a4ae9a067fd37c9f7f40047b2d8b92b2727db070","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:41:57.857103Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12268/citation-record","integrity":"/paper/2505.12268/integrity","json":"/paper/2505.12268/citation-record.json","paper":"/paper/2505.12268"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:58.710685Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":"ab19611c-08fb-42c7-8d88-d92f7f78d391","year":2019},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.697855Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:81f01a78e377303fa42f0e2371e11e2c5d09b5d91ef53e99af528e8b27a9f358","observation_id":"a5082a35-1917-4b11-9bee-9eba6da766fa","resolution":{"observed_at":"2026-08-15T20:41:58.720514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-16T13:37:26.527260Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-15T20:41:57.713019Z","title":"Clément Dumas, Jiannan Gu, Charles Wang, and Jiuqiang Huang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.713019Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:fdd715bfb7ab6c0383370ce9ebc7de0aa9bba9aa9be94f2518089ff1af053bfe","observation_id":"31e54323-2bdd-4f38-8adf-3d2c38cb5fb2","resolution":{"observed_at":"2026-08-15T20:41:57.713019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-15T20:41:57.735467Z","title":"Xinyun Ge and Torsten Hoefler","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.735467Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:52361f554c766a41ee20840aa2d75779578d1cf9f0dfa22b4014a4e7359647db","observation_id":"2758c388-4eea-4f35-bccd-c27306f92bc6","resolution":{"observed_at":"2026-08-15T20:41:57.735467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13868","last_updated":"2024-07-21T11:42:32Z","snapshot_observed_at":"2026-08-16T13:50:31.547274Z","submitted_at":"2024-05-22T17:50:04Z","title":"Automatically Identifying Local and Global Circuits with Linear Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13868","snapshot_observed_at":"2026-08-15T20:41:57.746262Z","title":"Mor Geva, Roei Schuster, Jonathan Berant, and Omer Levy","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.746262Z"},"links":{"cited_paper":"/paper/2405.13868","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:e581e1cbd2367f3faaffa37d408d179a2fac60072ca8be8c35959a9dcb758122","observation_id":"40a80de9-8fb3-432b-8930-313ba78f6b85","resolution":{"observed_at":"2026-08-15T20:41:57.746262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:58.651512Z","title":"A structural probe for finding syntax in word representations","venue":null,"work_id":"59e251bb-3f29-4e31-bfbd-9b5d3d9ff541","year":2019},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.756663Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:8a811254c6141ccaeb605806caf5610530c0f794dd3e34026ab2d32d2ae0b59b","observation_id":"97258de6-1dd7-4a72-bca0-e374b93edbb0","resolution":{"observed_at":"2026-08-15T20:41:58.658711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00873","last_updated":"2025-02-02T18:55:26Z","snapshot_observed_at":"2026-08-15T20:33:08.966874Z","submitted_at":"2025-02-02T18:55:26Z","title":"Language Models Use Trigonometry to Do Addition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00873","snapshot_observed_at":"2026-08-15T20:41:57.767445Z","title":"10 Jack Lindsey, Henry Cunningham, and Chris Olah","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.767445Z"},"links":{"cited_paper":"/paper/2502.00873","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:5165efad0904ea422951c97e4c2f953a13cfdbc959621f943ff18bb76fc87e52","observation_id":"8b18c6d1-e4d3-41ad-83a0-82e88774668c","resolution":{"observed_at":"2026-08-15T20:41:57.767445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17677","last_updated":"2024-03-26T13:05:02Z","snapshot_observed_at":"2026-08-16T14:06:16.824901Z","submitted_at":"2024-03-26T13:05:02Z","title":"Onboard deep lossless and near-lossless predictive coding of hyperspectral images with line-based attention","version":1},"cited_work":{"arxiv_id":"2403.17677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.17677","snapshot_observed_at":"2026-08-15T20:41:58.340462Z","title":"Onboard deep lossless and near-lossless predictive coding of hyperspectral images with line-based attention","venue":"eess.IV","work_id":"726594a4-402c-437d-9ed5-becc452ceb16","year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.774976Z"},"links":{"cited_paper":"/paper/2403.17677","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:ca7562effd15da19f94ce47a7b97fc502d484bfad5c7bf7189a2a7e35d0f624f","observation_id":"1ffdf4d0-d5bb-4961-ac75-ea6d1f1ead9f","resolution":{"observed_at":"2026-08-15T20:41:58.347588Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-08-14T07:35:01.333549Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-15T20:41:57.783451Z","title":"Paul Michel, Omer Levy, and Graham Neubig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.783451Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:715127a2e28a59a4b9a262f5f9d2bde041923cb9a8e80245cd0068d99c1ea67b","observation_id":"440a097c-656c-4f0f-a9a0-aa3c490c71ba","resolution":{"observed_at":"2026-08-15T20:41:57.783451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15054","last_updated":"2023-10-20T12:13:27Z","snapshot_observed_at":"2026-08-13T11:34:33.422769Z","submitted_at":"2023-05-24T11:43:47Z","title":"A Mechanistic Interpretation of Arithmetic Reasoning in Language Models using Causal Mediation Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15054","snapshot_observed_at":"2026-08-15T20:41:57.806134Z","title":"Moin Taufeeque, John Lynch, Mario Lucic, and Nicholas Frosst","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.806134Z"},"links":{"cited_paper":"/paper/2305.15054","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:f86d218e55d6e73920bdf86d6ea2cb146986b11db2bd79389375fe90eec450ad","observation_id":"51320bff-1c9a-453c-981e-44cee6b1c88d","resolution":{"observed_at":"2026-08-15T20:41:57.806134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15421","last_updated":"2025-05-30T00:08:56Z","snapshot_observed_at":"2026-08-16T13:32:14.673954Z","submitted_at":"2024-07-22T06:57:34Z","title":"Planning in a recurrent neural network that plays Sokoban","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15421","snapshot_observed_at":"2026-08-15T20:41:57.812580Z","title":"Alexander Templeton, Chris Olah, and Neel Nanda","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.812580Z"},"links":{"cited_paper":"/paper/2407.15421","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:64db00cbe26e5669d7bd9ed3b3d0bda425a6677c4204571db826018297322832","observation_id":"d8059930-f293-4912-8a85-531183a2883b","resolution":{"observed_at":"2026-08-15T20:41:57.812580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06061","last_updated":"2024-06-10T07:18:24Z","snapshot_observed_at":"2026-08-16T13:44:39.441402Z","submitted_at":"2024-06-10T07:18:24Z","title":"Greedy SLIM: A SLIM-Based Approach For Preference Elicitation","version":1},"cited_work":{"arxiv_id":"2406.06061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06061","snapshot_observed_at":"2026-08-15T20:41:58.163843Z","title":"Greedy SLIM: A SLIM-Based Approach For Preference Elicitation","venue":"cs.IR","work_id":"603a8d86-a7a9-41f1-a0fa-707f03373ad2","year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.822374Z"},"links":{"cited_paper":"/paper/2406.06061","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:5ede15c67be647d900b8849461b50d793d4eece85563e069b5b488ef704e9e3c","observation_id":"a874f307-8349-43ce-af75-229ecd86002e","resolution":{"observed_at":"2026-08-15T20:41:58.180758Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16837","last_updated":"2025-05-31T11:20:49Z","snapshot_observed_at":"2026-08-16T14:15:11.344234Z","submitted_at":"2024-02-26T18:57:54Z","title":"Do Large Language Models Latently Perform Multi-Hop Reasoning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16837","snapshot_observed_at":"2026-08-15T20:41:57.829613Z","title":"Zeming Yu, Wenxuan Zhang, Jie Zhou, and Rui Cao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.829613Z"},"links":{"cited_paper":"/paper/2402.16837","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:8cbaecf94b5c843ac1492ef9c761007795638c005302f25cc1f5f381a59de6c4","observation_id":"0a511791-e9b3-46f4-a480-65a6d0a544fc","resolution":{"observed_at":"2026-08-15T20:41:57.829613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10835","last_updated":"2025-02-15T15:36:42Z","snapshot_observed_at":"2026-08-16T12:58:07.821989Z","submitted_at":"2025-02-15T15:36:42Z","title":"Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10835","snapshot_observed_at":"2026-08-15T20:41:57.837990Z","title":"Rui Zhang, Ziyang Liu, and Ge Fu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.837990Z"},"links":{"cited_paper":"/paper/2502.10835","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:dc653c0e294533fccf4bf050d6064c7d244e93c121c5440ae93af5b28a81554c","observation_id":"0f918cea-6a9c-42de-bfe7-3316fd7c7214","resolution":{"observed_at":"2026-08-15T20:41:57.837990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09223","last_updated":"2024-10-11T19:57:55Z","snapshot_observed_at":"2026-08-16T13:10:11.217532Z","submitted_at":"2024-10-11T19:57:55Z","title":"The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09223","snapshot_observed_at":"2026-08-15T20:41:57.847407Z","title":"Wayne Xin Zhao, Kun Zhou, Junyi Li, Tianyi Tang, Xiaolei Wang, Yupeng Hou, Yingqian Min, Beichen Zhang, Junjie Zhang, Zican Dong, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.847407Z"},"links":{"cited_paper":"/paper/2410.09223","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:d03697fc45e73b0b748b9a68857728269dfee125b56b0db7fd03d06e1ebdd917","observation_id":"0cd8144b-9469-465b-9e17-ea312c87ba26","resolution":{"observed_at":"2026-08-15T20:41:57.847407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03445","last_updated":"2024-06-05T16:40:53Z","snapshot_observed_at":"2026-08-16T13:45:48.818437Z","submitted_at":"2024-06-05T16:40:53Z","title":"Pre-trained Large Language Models Use Fourier Features to Compute Addition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03445","snapshot_observed_at":"2026-08-15T20:41:57.857103Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.857103Z"},"links":{"cited_paper":"/paper/2406.03445","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:e682a0f7b6c0dd30f2c945bfbbc59d344921474780d4be977b8682da50d807ad","observation_id":"23e470d9-494f-4ca0-847e-47ff2cb4e4a5","resolution":{"observed_at":"2026-08-15T20:41:57.857103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T20:41:57.707058Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.707058Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:3112748ed80663bb017e2fbd636c3cf231de8b27efb9546a2395e9e7e10c29b9","observation_id":"80d84e79-42d6-4a6c-9b71-27d15d99acab","resolution":{"observed_at":"2026-08-15T20:41:57.707058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:57.798063Z","title":"Andrew Stolfo, Atticus Geiger, David Friedman, and Vivek Srikumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.798063Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:2f8e2cf806904a3a32569147844d62bf9e80fb7ba4cd2123b47da9ee41c11160","observation_id":"5942f11e-34e8-4f12-9e3c-73ebb11e926f","resolution":{"observed_at":"2026-08-15T20:41:57.798063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:58.679351Z","title":"Lucy Gao, Lachlan Reynolds, Neel Nanda, and Chris Olah","venue":null,"work_id":"b756a16d-954c-46b0-9acb-8502f7273314","year":2021},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.723708Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:172d14bc3b6483e7da437c2b1583a6c17013b49e80127c59b84080fa2303d6d3","observation_id":"dbb3afd0-cdf1-4716-93ec-40fce452e4c0","resolution":{"observed_at":"2026-08-15T20:41:58.685822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04709","last_updated":"2025-05-08T23:00:37Z","snapshot_observed_at":"2026-08-13T13:05:41.356773Z","submitted_at":"2023-01-11T20:42:41Z","title":"Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04709","snapshot_observed_at":"2026-08-15T20:41:57.678412Z","title":"Transformer Circuits Thread","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.678412Z"},"links":{"cited_paper":"/paper/2301.04709","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:2b77f733e315f862539f2918b7c3b50f0c89daa6fdade764accadc4dcdc6645b","observation_id":"831539e5-aef9-43d1-9f5a-1fa53e94a015","resolution":{"observed_at":"2026-08-15T20:41:57.678412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12775","last_updated":"2024-10-14T09:55:12Z","snapshot_observed_at":"2026-08-16T13:41:45.691214Z","submitted_at":"2024-06-18T16:44:13Z","title":"Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12775","snapshot_observed_at":"2026-08-15T20:41:57.669378Z","title":"Thomas Bricken, Catherine Olsson, Matthew Ziegler, Nelson Elhage, Neel Nanda, and Chris Olah","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.669378Z"},"links":{"cited_paper":"/paper/2406.12775","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:e7c8c6321c4c5c6eb083457a2046cb0ef58e9752ca42b92be07d784620bd050d","observation_id":"050025f9-5eb3-4283-b2e6-1356f1c0b97d","resolution":{"observed_at":"2026-08-15T20:41:57.669378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06346","last_updated":"2025-05-23T13:42:27Z","snapshot_observed_at":"2026-08-16T12:59:14.725250Z","submitted_at":"2025-01-10T21:18:21Z","title":"Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06346","snapshot_observed_at":"2026-08-15T20:41:57.686649Z","title":"Tristan Bush, Rohin Shah, and Jan Leike","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.686649Z"},"links":{"cited_paper":"/paper/2501.06346","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:50a9a51dcb962febb41650c918cb5abee6f8a77b3437dfc57cfd642c1a0d3e07","observation_id":"051ef9ac-a2d4-4b48-a5ac-1d69ebca18c1","resolution":{"observed_at":"2026-08-15T20:41:57.686649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:35:07.214252Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2505.12268."}