{"as_of":"2026-07-22T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08a1691f0c8b382e6665d11816f723218c171756b883b1074c0891d92b33ff3b","coverage":[{"denominator":293,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":115,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":115,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-22T06:31:00.163083+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T21:57:28.977088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T05:27:39.623381Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-07-06T22:45:25.047172Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:a957de201fa4f64b730f0b67385413c6b9361179592b343744122cc86d929438","observation_id":"db7c344a-33ed-4e21-bf4a-efeaf9d8d115","resolution":{"observed_at":"2026-05-16T06:00:40.730979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2604.09711","last_updated":"2026-04-08T04:13:55Z","snapshot_observed_at":"2026-07-06T22:58:29.952947Z","submitted_at":"2026-04-08T04:13:55Z","title":"Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:21.558650Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2604.09711"},"observation_digest":"sha256:386b13eb993409850085677b06ef0cfcc4bc552729c8606a401988a9c53bb3bb","observation_id":"5859c0dc-d0a2-43a5-a65c-6d7cfd8820b9","resolution":{"observed_at":"2026-05-11T00:50:50.375821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:dffd53bc38b9f6e592e80357a2c483a413c21b24b7259cefbdb4f2b0e3e47283","observation_id":"b8481f70-56b4-4759-a618-a19ecdabd51a","resolution":{"observed_at":"2026-05-11T09:05:58.188305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2604.11467","last_updated":"2026-05-26T10:03:53Z","snapshot_observed_at":"2026-07-12T21:57:23.843830Z","submitted_at":"2026-04-13T13:41:57Z","title":"From Attribution to Action: A Human-Centered Application of Activation Steering","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T14:59:12.966608Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2604.11467"},"observation_digest":"sha256:8fe937b748a68a067d96b747b80e18f85f5d1d12dccd1b0a4292982d3ea92e65","observation_id":"5471908f-73fc-4b92-b61f-7e658dbf550f","resolution":{"observed_at":"2026-05-11T11:21:04.815363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-12T21:57:28.977088Z","title":"Locate, steer, and improve: A practical survey of actionable mechanistic interpretability in large language models.arXiv preprint arXiv:2601.14004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.11467","last_updated":"2026-05-26T10:03:53Z","snapshot_observed_at":"2026-07-12T21:57:23.843830Z","submitted_at":"2026-04-13T13:41:57Z","title":"From Attribution to Action: A Human-Centered Application of Activation Steering","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T21:57:28.977088Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2604.11467"},"observation_digest":"sha256:838998679f623f8517c0f5c92341c85d626f966f7b35aaa939a00d8e7dd5d30a","observation_id":"3fa89818-a76b-4b96-8a13-a499532f9b62","resolution":{"observed_at":"2026-07-12T21:57:28.977088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2605.01844","last_updated":"2026-06-04T12:53:36Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T12:26:13Z","title":"The Cylindrical Representation Hypothesis for Language Model Steering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T00:10:29.122196Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2605.01844"},"observation_digest":"sha256:25add9ad2db560752cb7cf2ba56ff768751c6ddbe2877480578d51629f3a061f","observation_id":"94eddccc-b65a-4bdb-9983-caa8ab68973b","resolution":{"observed_at":"2026-07-01T00:15:09.220362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2605.06076","last_updated":"2026-05-07T11:59:52Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T11:59:52Z","title":"Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T10:44:07.426652Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2605.06076"},"observation_digest":"sha256:42188d869caa24d1dd22df4727155981676beb92dc31f77dda806d64d2daf526","observation_id":"8505f45a-61d9-42c2-911a-6298a4bb58de","resolution":{"observed_at":"2026-05-11T19:56:07.741092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2605.11416","last_updated":"2026-05-21T18:02:09Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T02:11:31Z","title":"Freeze Deep, Train Shallow: Interpretable Layer Allocation for Continued Pre-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T02:40:01.079531Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2605.11416"},"observation_digest":"sha256:282570ae4db6dd38c64bc871d620f75ca97045cfa1d3e4d42d5ee7399319490c","observation_id":"739a65f5-220d-4d32-b357-d1557badf70a","resolution":{"observed_at":"2026-05-13T02:42:08.382307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2605.11416","last_updated":"2026-05-21T18:02:09Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T02:11:31Z","title":"Freeze Deep, Train Shallow: Interpretable Layer Allocation for Continued Pre-Training","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-25T06:41:18.569888Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2605.11416"},"observation_digest":"sha256:7aec5f218276113d8bbe0d370291989687e3913cc7fd3ef8d28cc7989275150d","observation_id":"9190af20-379f-4fe8-a19a-6288460b472a","resolution":{"observed_at":"2026-05-25T06:45:26.246766Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2605.11887","last_updated":"2026-05-12T10:01:06Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T10:01:06Z","title":"Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-13T05:38:31.094834Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2605.11887"},"observation_digest":"sha256:dbb2acf704d889860f4da18c5d61b05c0a52725fa572c91ae4841b45a563a067","observation_id":"6f144e3e-a45a-427b-b8d9-9b3bd26e0b77","resolution":{"observed_at":"2026-05-13T05:42:21.092333Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-07-06T23:30:21.283826Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:af7aa434fbafc62dda78a3aac385d896888bc29bcc39047d0a0a90aed8ad12ac","observation_id":"7d4959ab-dc1e-4bff-b233-1d56600a080d","resolution":{"observed_at":"2026-05-20T07:58:07.575931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2606.00160","last_updated":"2026-05-29T09:04:27Z","snapshot_observed_at":"2026-07-06T23:40:56.510371Z","submitted_at":"2026-05-29T09:04:27Z","title":"DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T22:09:02.498712Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2606.00160"},"observation_digest":"sha256:f4241e7d194f72405b393b9e8a5635711b60da834a0b2114724d1160fc9319f6","observation_id":"ecd68893-32be-464c-9ce4-2f0d99d60289","resolution":{"observed_at":"2026-07-01T19:46:10.223820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-07-12T23:17:32.662688Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:dc72f96160b157774ac5821a60693c0b3df3e4ea180a9c81a395895e73bdcb28","observation_id":"e9fda900-ecda-4f1b-ada9-2b811b5cd39e","resolution":{"observed_at":"2026-07-01T14:05:47.042635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"Locate, steer, and improve: A practical survey of actionable mechanistic interpretability in large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-07-12T23:17:32.662688Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:a6690f849b433cfb8bb3b4fbc294e23fe00ac270d035c0d1e9ef1171d6d04207","observation_id":"1df6662f-2293-49e3-8999-1b969d70c1be","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2606.10794","last_updated":"2026-06-10T08:17:06Z","snapshot_observed_at":"2026-07-06T23:49:56.404171Z","submitted_at":"2026-06-09T12:43:49Z","title":"READER: Robust Evidence-based Authorship Decoding via Extracted Representations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T13:19:48.681128Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2606.10794"},"observation_digest":"sha256:01cbbde4e337393997eb849e029b6d11f009483dbcd000341ded6ce6d1ae6544","observation_id":"b7ef4b74-8caa-47b0-89ab-70c3e3e99175","resolution":{"observed_at":"2026-07-03T05:27:39.624645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.14004/citation-record","integrity":"/paper/2601.14004/integrity","json":"/paper/2601.14004/citation-record.json","paper":"/paper/2601.14004"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elucidating mechanisms of de- mographic bias in llms for healthcare.arXiv preprint arXiv:2502.13319","venue":null,"work_id":"8bf8237b-4db0-4e8d-a491-05a43967ca60","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:ac03e348a5e00c7859bbddb7d2b60c1f56e4865d2fa69c27341b890ff8ee2c26","observation_id":"0672aa96-0c88-43da-9148-9ee039aa2e51","resolution":{"observed_at":"2026-05-16T12:40:54.794203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1105.2024","last_updated":"2011-11-03T16:45:47Z","snapshot_observed_at":"2026-07-06T02:27:32.896604Z","submitted_at":"2011-05-10T19:21:34Z","title":"Symbols of One-Loop Integrals From Mixed Tate Motives","version":2},"cited_work":{"arxiv_id":"1105.2024","doi":"10.1109/compsac61105.2024.00017","metadata_source":"pith","pith_arxiv_id":"1105.2024","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Symbols of One-Loop Integrals From Mixed Tate Motives","venue":"hep-th","work_id":"40501962-0bff-41fd-a4e4-3e8f4b8eb2a5","year":2011},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1105.2024","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:db33188919eb8bb5c8ebbcf823ee3bd343cc462b036b0ec4278c09429b455804","observation_id":"f14ce2ad-728a-48f3-ae40-57bbb27c9584","resolution":{"observed_at":"2026-05-16T12:40:54.422564Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding intermediate layers using linear classifier probes","venue":null,"work_id":"ea0ebe23-646e-4020-8bf3-c38c5fce8826","year":2017},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:1c3fe33edb5414bdb785597f35619107a3cf09d53a0823b207ac874f4d73587a","observation_id":"fb788280-b010-4292-b190-77c097ee5f17","resolution":{"observed_at":"2026-05-16T12:40:55.214050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13673","last_updated":"2025-05-19T11:12:27Z","snapshot_observed_at":"2026-07-06T15:31:05.250637Z","submitted_at":"2023-05-23T04:28:16Z","title":"Physics of Language Models: Part 1, Learning Hierarchical Language Structures","version":4},"cited_work":{"arxiv_id":"2305.13673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13673","snapshot_observed_at":"2026-07-04T03:49:29.646674Z","title":"Physics of language models: Part 1, learning hierarchical language structures","venue":null,"work_id":"4c55171a-91be-43c4-9b1b-87eb87c6593d","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2305.13673","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:98c0494d440379111b6b154c2e0112d56f02ac9257eaaba4647472c724adb2b2","observation_id":"71f02f0c-2efb-48f1-a49e-56bb77c4408e","resolution":{"observed_at":"2026-05-16T12:40:54.841133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"98f3073c-2eac-4d91-b73a-d15bec79f7b6","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:e11b9da75c281654d0badcf35a05c3b72391f992a5024b21a5ad6188494433b9","observation_id":"024d76ad-7665-40ba-bcdf-41f7215c0cbb","resolution":{"observed_at":"2026-05-16T12:40:55.289542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06415","last_updated":"2025-02-26T01:59:40Z","snapshot_observed_at":"2026-07-06T20:33:57.434346Z","submitted_at":"2025-02-10T12:54:17Z","title":"Systematic Outliers in Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.06415","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06415","snapshot_observed_at":"2026-07-10T02:26:42.777951Z","title":"Systematic outliers in large language models","venue":"cs.CL","work_id":"5b7b454a-39df-464f-ac5e-d0c154670a7b","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2502.06415","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:a9ec61596e4b5f623269987ded3419acc880a4f106b6ed22bf4b97f25929a71b","observation_id":"04572805-1ac4-4057-b47d-53c2646ac69b","resolution":{"observed_at":"2026-05-16T12:40:54.608787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.11230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse autoencoders can capture language-specific concepts across diverse languages","venue":null,"work_id":"4faf54f4-42b5-4bcf-beb0-34651f2ea693","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:a0ce2b8ad8ec09fbc0e6a4e8ace05f6d366ed637e6e5eb56d30d9c70291a25e4","observation_id":"05e4d76b-3ecc-449a-a9af-7ae2764d9c39","resolution":{"observed_at":"2026-05-16T12:40:54.797250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:18:44.315417Z","title":"Saes are good for steering–if you select the right features","venue":null,"work_id":"b8952165-962f-40b3-9d0f-6537faaf826c","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:fb33d524a36e417711dbd26ac973c7e9fc774fa1827c23ef01460148970c9e62","observation_id":"2f354463-2a42-4d0b-ac68-5d2546d742b4","resolution":{"observed_at":"2026-05-16T12:40:54.728176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":"42a900c1-ce9b-4e7b-adc2-c7f4b7207603","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:022d66bb174beeaadfc875f0a8b3e27f424fd63e78f9f2a2b5f7f5aef96086a6","observation_id":"350b460d-f307-4106-9a77-72a939f81653","resolution":{"observed_at":"2026-05-16T12:40:55.332730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7916.374109","doi":"10.5555/3737916.3741096","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms.Advances in Neural Information Processing Systems, 37:100213–100240","venue":null,"work_id":"2970b3ca-25a0-42b4-90a7-bb8f0ecf586a","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:360edbd2d969e77b893f6427a40b7543c19a5f87dc823aed543d62985bd2dc84","observation_id":"335abcd4-e082-4faa-bb1a-4a67ae4e20f8","resolution":{"observed_at":"2026-05-16T12:40:54.475705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libbrecht","venue":null,"work_id":"3163f91f-dfd4-43e9-ac7e-76131546ceb2","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:dd287013df83696f6aa3f4e31b6c8809bf4ce597a76c4c39b5b5e9efbf47cc06","observation_id":"5df0ad2f-f9c5-41e2-baa4-e63d74380992","resolution":{"observed_at":"2026-05-16T12:40:55.328876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09289","last_updated":"2024-10-05T19:56:20Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T16:26:47Z","title":"Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.09289","doi":"10.48550/arxiv.2406.09289","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09289","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Understanding jailbreak success: A study of latent space dynamics in large language models","venue":null,"work_id":"605eb56b-28f0-4508-9d6e-9dbec034e5d0","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2406.09289","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:e2798f9c87114373b7994821398db3b9582f2bf173169b6e1f41726b94a4bd5f","observation_id":"5d89409f-fc51-40d1-bc23-ae7bdff66039","resolution":{"observed_at":"2026-05-16T12:40:54.788037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04484","last_updated":"2026-07-02T02:33:20Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T04:49:56Z","title":"Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness","version":2},"cited_work":{"arxiv_id":"2510.04484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.04484","snapshot_observed_at":"2026-07-03T02:16:46.519239Z","title":"Jan Betley, Daniel Tan, Niels Warncke, Anna Sztyber- Betley, Xuchan Bao, Martín Soto, Nathan Labenz, and Owain Evans","venue":null,"work_id":"abc92260-752b-4dee-9de8-518d18eefd06","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2510.04484","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:54836236f998bd74a805cca2fc6588a453b689186e608427cb6e98b648d8e8e8","observation_id":"e80f3e38-c2a9-41be-b253-462876d44ee7","resolution":{"observed_at":"2026-07-03T02:16:46.519239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:28:55.168350Z","title":"What can we actually steer? a multi-behavior study of activation control","venue":null,"work_id":"2f48f444-612c-457b-a318-26ce5c264612","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:0a9a0446f15164712f4e78ea2010877aedea0cb61151e884000c8f05ab429f9b","observation_id":"504eb541-2def-475a-9fdc-43f029d01ae0","resolution":{"observed_at":"2026-05-16T12:40:54.758539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00177","last_updated":"2025-02-28T20:43:45Z","snapshot_observed_at":"2026-07-06T20:44:41.083168Z","submitted_at":"2025-02-28T20:43:45Z","title":"Steering Large Language Model Activations in Sparse Spaces","version":1},"cited_work":{"arxiv_id":"2503.00177","doi":"10.48550/arxiv.2503.00177","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00177","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Steering large language model activations in sparse spaces.arXiv preprint arXiv:2503.00177","venue":null,"work_id":"e10f6b0d-fd6f-4116-a4a5-4f88c1e94d92","year":2014},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2503.00177","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:b7d046da6f8cc6cade188103a9632b1a4e838de460ebe3bff608aa626debcc9d","observation_id":"f643abdf-37bf-4643-92a3-e221791edef7","resolution":{"observed_at":"2026-05-16T12:40:54.808987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/coli","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:16:58.533033Z","title":"Cocarascu, F","venue":null,"work_id":"816c1e36-4060-4ea8-8f0b-b8c0efaf2db9","year":2022},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:8805861672bb4478b9460e87241032e194bc4fcd190a16624078bd01dfc703ab","observation_id":"4339f5b7-d596-4bdb-966f-d7397c39237d","resolution":{"observed_at":"2026-05-16T12:40:54.493158Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"cited_work":{"arxiv_id":"2303.08112","doi":"10.48550/arxiv.2303.08112","metadata_source":"pith","pith_arxiv_id":"2303.08112","snapshot_observed_at":"2026-07-10T11:57:03.240800Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","venue":"cs.LG","work_id":"a127314f-7424-488f-b6d7-8214650c420f","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2303.08112","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:794b96df9acc9320b08f0310bedda407230611e95b6371049f783f8a2427ed07","observation_id":"bf7efe3c-a9e9-4ea6-944c-78b10683e7f4","resolution":{"observed_at":"2026-05-16T12:40:54.609121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:41.570848+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:41.570848+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":"2404.14082","doi":"10.48550/arxiv.2404.14082","metadata_source":"pith","pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-07-10T08:06:57.494690Z","title":"Mechanistic Interpretability for AI Safety -- A Review","venue":"cs.AI","work_id":"45111204-32e8-4772-9cb5-b333c52c39e3","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d0a672785998df520f2f7160a95a857d731effa242271927ee7d8218b803c8e3","observation_id":"e3db4012-e2c4-4cf0-b235-2b06531caf07","resolution":{"observed_at":"2026-05-22T14:22:15.575714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:04.963653+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:04.963653+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling visual perception in language models: An attention head analysis approach","venue":null,"work_id":"220133cc-ca4e-40b3-8575-0cb67c98c8c7","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:e31d499daffc270957bcbe70c9e5bee38be422f43bf7b4f1fb72776e3fc12793","observation_id":"0418f7c9-780b-4b3d-b488-01c2af5f0242","resolution":{"observed_at":"2026-05-16T12:40:55.316514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.781","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:41:03.380140Z","title":"Hopping too late: Exploring the limitations of large language models on multi-hop queries","venue":null,"work_id":"40e167a0-111c-4756-9eba-9bf3f9f16498","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:65c6267621f8b77cd0f3543e3e3cf5efde1dab3b90a45b44381ea7fe2fffc10a","observation_id":"242fe570-c192-4d99-9a5e-5c8d2ff945d0","resolution":{"observed_at":"2026-05-16T12:40:54.463588Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open source sparse autoencoders for all residual stream layers of gpt2 small","venue":null,"work_id":"380cf774-970a-4ac7-9b2b-4f999b682df7","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:8878300e2fcf28e342b3e8b64c8c933b6648cda9a05777941cc2f64710452a96","observation_id":"2681558f-3e33-44ae-acd0-ad8211eac948","resolution":{"observed_at":"2026-05-16T12:40:55.318549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantizable transform- ers: Removing outliers by helping attention heads do nothing","venue":null,"work_id":"4342125d-3179-4142-b959-b0609db3799e","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:5fb696f82e2ec77538c69f642d7a49b5a2735f585900f264bddfb4191a4d4e9b","observation_id":"800a9146-8790-46a0-87ee-c4037aaf3655","resolution":{"observed_at":"2026-05-16T12:40:55.314498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24859","last_updated":"2026-05-11T16:22:38Z","snapshot_observed_at":"2026-07-06T21:33:50.814913Z","submitted_at":"2025-05-30T17:57:15Z","title":"Beyond Multiple Choice: Evaluating Steering Vectors for Summarization","version":3},"cited_work":{"arxiv_id":"2505.24859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24859","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond Multiple Choice: Evaluating Steering Vectors for Summarization","venue":"cs.LG","work_id":"dfac6449-ea03-4c59-b6ed-1dc2c6f9471b","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2505.24859","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:330149aa0bf7b6f7c90fc73dbbb406dddfbd573e5966f9ff666cdd5e32fc7637","observation_id":"28ba1fcd-ef15-4b82-bf06-28073c1c0149","resolution":{"observed_at":"2026-05-16T12:40:54.612372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention approximates sparse distributed memory.Advances in Neural Information Processing Systems, 34:15301–15315","venue":null,"work_id":"452c52f0-25b6-4697-945b-8f99b6dd1351","year":2021},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:841ffe7e948a5fb9f62c91c3d81cf88e7b8edf8991d598a8775bed34b8b2b0f7","observation_id":"fc67a028-09c9-4c24-ab15-b85ae69af7fd","resolution":{"observed_at":"2026-05-16T12:40:55.307559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning.Transformer Circuits Thread","venue":null,"work_id":"035aba74-4e6c-467c-bd13-b7591ab8f36f","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:53872e31ad28a3d31bca34be28ce5bd5ec1de3bc3a792e25c522eeaf9aa6925b","observation_id":"0c7415b8-fe14-4c32-8d08-740d999246c1","resolution":{"observed_at":"2026-05-16T12:40:55.309758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.naacl-long.312","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T02:15:14.181278Z","title":"Large language models share representations of latent grammatical concepts across typologically diverse languages","venue":null,"work_id":"b43cfb95-59c4-44c3-a699-7dd8156ae326","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:f4b722ce4ea10ba8d17c80ac884ffd3fa92c8902f74164321661bc3a946769cd","observation_id":"dfd20a62-1637-475e-8751-0ed2c31c21f8","resolution":{"observed_at":"2026-05-16T12:40:54.441919Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06410","last_updated":"2024-12-09T11:39:00Z","snapshot_observed_at":"2026-07-06T20:03:47.277630Z","submitted_at":"2024-12-09T11:39:00Z","title":"BatchTopK Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":"2412.06410","doi":"10.48550/arxiv.2412.06410","metadata_source":"pith","pith_arxiv_id":"2412.06410","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Batchtopk sparse autoencoders","venue":"cs.LG","work_id":"812bea0e-6edc-46bc-8213-fbf0ebf4b662","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2412.06410","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:cb1d7e330a27a353d297645edbca8988640c53b40c1706a988a3c7d819b710f4","observation_id":"1fc42ea8-6cec-423a-af82-df4145ac284c","resolution":{"observed_at":"2026-05-16T12:40:54.800252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Locating and Mitigating Gender Bias in Large Language Models, March 2024a","venue":null,"work_id":"ca4dc6c0-7dcd-4cca-8c0a-e374f08b43e5","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:c5f2f35d812bd4e30553b534f17b1470a232286a0cfa8925eb15107a820a3983","observation_id":"c9e7c049-7579-44fb-8511-4e162f33aebd","resolution":{"observed_at":"2026-05-16T12:40:55.384641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:63e1c43f1158051421d4ec4cac13a490ac87bf16038574feada18eb7f81522ac","observation_id":"a0d59ee3-8a6d-47c0-ad90-bf2af8c5be53","resolution":{"observed_at":"2026-05-16T12:40:54.722220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spectral filters, dark signals, and attention sinks","venue":null,"work_id":"f8befc47-df00-4191-8830-f39b30737861","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:bddc9c654f5044114bcd966cfeae6d329f64a1fab300c0fba7dc217fc0f5c5e1","observation_id":"3f941494-1f67-4850-8c3c-10d194b89aec","resolution":{"observed_at":"2026-05-16T12:40:55.368073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dissecting Bias in LLMs: A Mechanistic Inter- pretability Perspective, June 2025","venue":null,"work_id":"b83b34fd-06b4-4c75-8823-103b657182ee","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d0e03bdd47ce91aefeff1cc9ac53a43caf1c3cea0ae43fa12d0f14724cd532f3","observation_id":"f9d05a81-9b94-4da6-afb1-75407fe06a3d","resolution":{"observed_at":"2026-05-16T12:40:55.370488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07642","last_updated":"2025-09-09T14:42:53Z","snapshot_observed_at":"2026-07-06T21:38:59.043196Z","submitted_at":"2025-06-09T11:07:55Z","title":"TreeReview: A Dynamic Tree of Questions Framework for Deep and Efficient LLM-based Scientific Peer Review","version":3},"cited_work":{"arxiv_id":"2506.07642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07642","snapshot_observed_at":"2026-07-02T15:47:06.781359Z","title":"Treereview: A dynamic tree of questions framework for deep and efficient llm-based scientific peer review","venue":null,"work_id":"9b649b30-fd82-4f8f-a8ff-2aa8d702b356","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2506.07642","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:b4aa54d77edfc4c1c303175421185ea6d9ce397035a7f9bda259000c60654552","observation_id":"372a98ef-307e-4f5b-aee5-be7718a98a8e","resolution":{"observed_at":"2026-05-16T12:40:54.743424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.14507","doi":"10.48550/arxiv.2409.14507","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders , journal =","venue":null,"work_id":"3393e9a4-38a0-408a-a3d8-1f07891674e3","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d421619259aec78af674441007f63ae028800aa812a370980c6ea2c7f9f161f2","observation_id":"53f836a7-092f-4c93-a417-e28580e21987","resolution":{"observed_at":"2026-05-16T12:40:54.779390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:44.639758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:44.639758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.14507","doi":"10.48550/arxiv.2409.14507","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders , journal =","venue":null,"work_id":"3393e9a4-38a0-408a-a3d8-1f07891674e3","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:7a8b91ac31d5b304a4c0c32ca804afc0d9654d55797efcfa1d6067d8ec5f18d9","observation_id":"99249f8e-a6d3-4179-9b6f-bc497b75bc68","resolution":{"observed_at":"2026-05-16T12:40:54.371554Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:44.639758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:44.639758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferring linear features across language models with model stitching","venue":null,"work_id":"65ffb3a7-8615-4086-96e8-41dbefc5bf0a","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:dd4e420eabedf6eba2dd5850cdedc566d3b5c6914530b7fb08cbe1e363d08088","observation_id":"a2b08501-3761-40af-8687-c3b2e1db3f5b","resolution":{"observed_at":"2026-05-16T12:40:55.392327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards under- standing safety alignment: A mechanistic perspective from safety neurons, 2025b","venue":null,"work_id":"bd605137-8f96-4a94-9a82-a6cb25db2bfd","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:36aac598f7be8644875b94e20e275940d542f1a6ff90508452d9c8f914c1abc8","observation_id":"91c60308-2546-4eda-8728-d968f98374d8","resolution":{"observed_at":"2026-05-16T12:40:55.303719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i22.34529","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identifying query-relevant neurons in large language models for long-form texts","venue":null,"work_id":"dcfb0076-5d67-42cb-8179-f1bc0205fe83","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:06c376768eba86133592cac96b7f6879474941f396af84c26943608bc46372ab","observation_id":"6a099f27-0d54-47ad-9044-e7d70f0c7fdc","resolution":{"observed_at":"2026-05-16T12:40:54.478421Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-short.25","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learnable privacy neurons localization in language models","venue":null,"work_id":"9dff1264-41b6-4ae4-a7cc-06f17237ecf6","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:eb435f12d79ed32fb2037ad96a72d012261e73f429fd460ddeb0ce8369420190","observation_id":"2329709a-ca6d-4580-bc0c-4ac771d70645","resolution":{"observed_at":"2026-05-16T12:40:54.460914Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21509","last_updated":"2025-09-05T07:44:31Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T05:20:14Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","version":3},"cited_work":{"arxiv_id":"2507.21509","doi":"10.48550/arxiv.2507.21509","metadata_source":"pith","pith_arxiv_id":"2507.21509","snapshot_observed_at":"2026-07-10T15:37:20.461076Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","venue":"cs.CL","work_id":"cf32dbef-9132-4648-abcb-0ebf3ac3af80","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2507.21509","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:e4468d0428399b3688eed990e67c14647800e1b46c32da996be04ccc7bf222fb","observation_id":"a1cd1844-199a-40f9-99d0-8a6878e803e7","resolution":{"observed_at":"2026-05-16T12:40:54.670885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:54.586724+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:54.586724+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In-context sharpness as alerts: An inner representation perspective for hallucination mitigation","venue":null,"work_id":"7ae6aa82-8ebb-46e2-b1ba-783584a11817","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:1edb82d8b44ba8b74326ea5ad2a10d16d122d2740a43b03e2b6c1d4b238fdfd8","observation_id":"834c8db7-8a8b-44fb-8e0f-9cf66c03dd35","resolution":{"observed_at":"2026-05-16T12:40:55.299875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From yes-men to truth-tellers: Addressing sycophancy in large language models with pinpoint tuning","venue":null,"work_id":"cea28dbc-390b-404a-a145-a6da1c1a490e","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:430c6806ee49934d470dcf6d8ffcf69d9193d3f0d4c11c1e33f35163360f4dfd","observation_id":"69ebec01-6283-49a2-90a3-d5d045573c9e","resolution":{"observed_at":"2026-05-16T12:40:55.301728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i16.29735","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journey to the center of the knowl- edge neurons: Discoveries of language-independent knowledge neurons and degenerate knowledge neurons","venue":null,"work_id":"ba8e14b6-56c7-441d-9684-3fc78fa8917b","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:c0c721c99a195f6ca9b5d9fcb08a20875b1c042ce87855f6433c23982bf8cde9","observation_id":"b8b37a46-cf81-4567-9bb4-5b5dff66a14f","resolution":{"observed_at":"2026-05-16T12:40:54.435233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c624a9a-5770-47de-ab0d-1fa464d7f412","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:2e8a4787dd3e6f194408d71b7be37ba1cac04f97d299d36af3668e64a0868108","observation_id":"66143978-e12c-4353-837d-db6c5861b258","resolution":{"observed_at":"2026-05-16T12:40:55.295780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Binary autoencoder for mechanistic interpretability of large language models","venue":null,"work_id":"e66726ed-ba9a-4a11-8ab9-386abdf2b3fe","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:87ef6e5cd13c860cf293054f5416dfab9b0f76f746a9ffadbb12a98627b14954","observation_id":"a5e765ac-5271-4e42-a298-9bbfab366a78","resolution":{"observed_at":"2026-05-16T12:40:54.654738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towardefficientsparseautoencoder-guidedsteeringforimproved in-context learning in large language models","venue":null,"work_id":"4b44cc9e-5c9f-43e7-ac5c-359356b83f95","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:a0d4dfc1e4eedd9ccfc6038bb443d339c8d535c2be369c61039f957e97c41391","observation_id":"e76b0cad-90f9-4c95-b052-450945f8edb3","resolution":{"observed_at":"2026-05-16T12:40:55.293914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glass, and Pengcheng He","venue":null,"work_id":"d62c7527-4761-4071-b85f-5268b3a37020","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:1258e84d5816af69febb1f6bea82341b1fd9445a59e210a66a67180960e4630f","observation_id":"0096938e-6cb1-4544-a8dc-e1e5aadac6a5","resolution":{"observed_at":"2026-05-16T12:40:55.322434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02449","last_updated":"2024-06-04T16:14:00Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T16:14:00Z","title":"Representations as Language: An Information-Theoretic Framework for Interpretability","version":1},"cited_work":{"arxiv_id":"2406.02449","doi":"10.48550/arxiv.2406.02449","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02449","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Representations as language: An information-theoretic framework for interpretability","venue":null,"work_id":"b89d1ca6-21d0-4431-bccd-b988983f7c2a","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2406.02449","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:21b78461a93b6a1043445e2c37b32f3fa9470f7e8891ea83539cc9dfb6b67042","observation_id":"e2449ef2-9dbb-46bf-97ce-1a8ba737fc1e","resolution":{"observed_at":"2026-05-16T12:40:54.659255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":"4bfcd45d-ee50-4aad-870e-59017dea5967","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:2fd9ffad4a030f092ce65728a78631e536b26074870b908192ffd47bca015841","observation_id":"8affefe7-1118-4781-b13e-9eed0ff0b85b","resolution":{"observed_at":"2026-05-16T12:40:55.297867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p18-1198","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:23:53.262853Z","title":"What you can cram into a single \\ & ! \\# * vector: Probing sentence embeddings for linguistic properties","venue":null,"work_id":"d0b41368-6cbc-41b6-8585-6f7b3af51bbc","year":2018},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:b70aa3feca0af3ae82f7578588e77cf8b3a189c27e6ac9f2f52504f19da20cd1","observation_id":"381b13fe-c091-4cd0-87ab-ea00d6a708be","resolution":{"observed_at":"2026-05-16T12:40:54.434246Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":"2309.08600","doi":"10.1145/1390156.1390191","metadata_source":"pith","pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","venue":"cs.LG","work_id":"51960d72-c69f-4db8-8efd-e90e8b4d9524","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:0b29994e02c37516b2cbe837ccde943a611aa25b1ec52875f8c87ed854aa0108","observation_id":"29cd555a-5822-4909-b319-a0c6c0744dc4","resolution":{"observed_at":"2026-05-16T12:40:54.681708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:19.66582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:19.66582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we interpret latent reasoning using current mechanistic interpretabil- ity tools?","venue":null,"work_id":"64e3f53a-1ce9-4373-9edc-ff75d4132a4c","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:8cd8867ea8c8d88aa539626f868c92c3fc2603ef71d1344bdee951f95ef280fb","observation_id":"895162b7-c940-4967-b775-a6c5d934d0f8","resolution":{"observed_at":"2026-05-16T12:40:55.324594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04635","last_updated":"2025-04-06T22:19:46Z","snapshot_observed_at":"2026-07-06T21:05:11.303685Z","submitted_at":"2025-04-06T22:19:46Z","title":"Steering off Course: Reliability Challenges in Steering Language Models","version":1},"cited_work":{"arxiv_id":"2504.04635","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04635","snapshot_observed_at":"2026-07-03T14:08:21.826458Z","title":"Steering off course: Reliability challenges in steering language models","venue":null,"work_id":"0f378e84-657f-47c5-a8df-5e81dffde423","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2504.04635","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:2f53206580ff370b7e1bcd6e7e8a43f4ccf2b0baca194823591721ff34eccedd","observation_id":"fda1942d-568b-43f2-b5e1-6b6df3462f30","resolution":{"observed_at":"2026-05-16T12:40:54.689103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.581","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:16:58.518831Z","title":"doi: 10.18653/v1/2022.acl-long.581","venue":null,"work_id":"e08c111e-12b3-4697-bdbb-3b107a7d76e3","year":2022},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:c254a769faf7cbb6f818aec9ce30cfa9c7593891765703b966ba87afc75f3925","observation_id":"c87873f3-0468-4c00-99bf-5df4837057c2","resolution":{"observed_at":"2026-05-16T12:40:54.431709Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:51:26.684074+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:51:26.684074+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05859","last_updated":"2024-08-11T20:50:16Z","snapshot_observed_at":"2026-07-06T18:59:25.428215Z","submitted_at":"2024-08-11T20:50:16Z","title":"The Cognitive Revolution in Interpretability: From Explaining Behavior to Interpreting Representations and Algorithms","version":1},"cited_work":{"arxiv_id":"2408.05859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.05859","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The cognitive revolution in interpretability: From explaining behavior to interpreting representations and algorithms","venue":null,"work_id":"ed1b001a-052f-496e-a00b-08fa04f81fa8","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2408.05859","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:9bce1acb1b592d2e3530ddc2b9ef668c5ed1297a1e6a2bfdf1f5c872b77ee80f","observation_id":"ff4483d5-8410-4bc1-b79a-3da158f241a6","resolution":{"observed_at":"2026-05-16T12:40:54.694199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neuron based personality trait induction in large language models","venue":null,"work_id":"148cc1aa-2fba-4a82-b922-3aa6e7cee140","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:7c17e7637ef1af105b15bad21b6f46d867609c53f3a41b3cc5fb5b1609d06937","observation_id":"2aa14787-030b-4f77-a841-7889563c6333","resolution":{"observed_at":"2026-05-16T12:40:55.277205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9a5d80fe-ed9f-4056-8f9b-178591b3a0bc","year":2022},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:51865065eda45c4b8ce57c0aa023587cde0498d45558a233e499dfe93f003202","observation_id":"dbd65c2a-12b4-44b8-aa49-c40d6d0d2068","resolution":{"observed_at":"2026-05-16T12:40:55.355921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3768292","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5","venue":null,"work_id":"147dbdb2-c39f-4da6-bfbd-f3e5d49a27d8","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:a30fa4f24c8232f65288f2f45a89045f20466d121cf3f333515b61046bf156ed","observation_id":"ec0c7c2e-7b1b-4f8b-9af0-48d0ba391029","resolution":{"observed_at":"2026-05-16T12:40:54.402027Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20229","last_updated":"2025-05-26T17:08:02Z","snapshot_observed_at":"2026-07-06T21:30:46.863005Z","submitted_at":"2025-05-26T17:08:02Z","title":"From What to How: Attributing CLIP's Latent Components Reveals Unexpected Semantic Reliance","version":1},"cited_work":{"arxiv_id":"2505.20229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20229","snapshot_observed_at":"2026-07-03T14:48:32.537459Z","title":"From what to how: Attributing clip’s latent components reveals unexpected semantic reliance","venue":null,"work_id":"611a3ae4-cb5e-4cc8-bfc0-643316f056e1","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2505.20229","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:bdfb4e71989f54bb68de406f8ab1d542b09d50bcdafb7464fa2451fa68c1ade7","observation_id":"302b0a82-ce11-4f6c-9c6d-f38e450855f9","resolution":{"observed_at":"2026-05-16T12:40:54.852122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04524","last_updated":"2025-02-17T02:32:33Z","snapshot_observed_at":"2026-07-06T19:28:39.495408Z","submitted_at":"2024-10-06T15:34:04Z","title":"Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2410.04524","doi":"10.48550/arxiv.2410.04524","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.04524","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Towards secure tuning: Mitigating security risks arising from benign instruction fine-tuning","venue":null,"work_id":"ba087fb5-090b-4bd1-8504-6899076427da","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2410.04524","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:72ec122077bb7a0ccff83009a72303d3cc189d5c328d772e1060d4cd7273bf54","observation_id":"5924b097-09e9-462d-8eb5-a4d38184c206","resolution":{"observed_at":"2026-05-16T12:40:54.418934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling language competence neurons: A psycholinguistic approach to model interpretability","venue":null,"work_id":"f6149ebf-85d0-4cd1-80a5-0dd6e3d73c43","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:37f7a830c14f93398d9d0219f332390d28a3171d005d0d6f5a568a0a24f21610","observation_id":"37bc8d4c-c7fb-4a4e-8607-4106d82d1784","resolution":{"observed_at":"2026-05-16T12:40:55.283129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 3 herd of models","venue":null,"work_id":"d8b489e8-492f-4dc7-bd14-2343b00faa47","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:1e770428da39363b120fb393312225db15f377c7c356df3a4db3b79220ffa6e1","observation_id":"ab34e422-cff5-4907-928a-159cfee6b5e0","resolution":{"observed_at":"2026-05-16T12:40:55.260729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17415","last_updated":"2024-10-28T08:59:01Z","snapshot_observed_at":"2026-07-06T18:36:38.636181Z","submitted_at":"2024-06-25T09:37:15Z","title":"Layer-Wise Quantization: A Pragmatic and Effective Method for Quantizing LLMs Beyond Integer Bit-Levels","version":3},"cited_work":{"arxiv_id":"2406.17415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17415","snapshot_observed_at":"2026-07-02T15:57:06.548416Z","title":"Layer-wise quantization: A pragmatic and effective method for quantizing llms beyond integer bit- levels","venue":null,"work_id":"3cb628b7-9c3d-4943-a3a2-331447512fee","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2406.17415","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:5a4a0bd4e31fed00874c774fb5584bd010b5744a85cee984d47430b5f02dfb23","observation_id":"21ec9fd3-ee4f-49dc-a081-6b568a350763","resolution":{"observed_at":"2026-05-16T12:40:54.792220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A mathemati- cal framework for transformer circuits.Transformer Circuits Thread","venue":null,"work_id":"c8da9104-56e2-4f13-8736-0429fec1d6c5","year":2021},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:c5cea79f8841b0c1b75530ad472ba4cb02586a7ac7ce0ae6e605ae4f5db48eae","observation_id":"bb64a1e1-7d1f-4aa5-9480-3b70baaa0e8f","resolution":{"observed_at":"2026-05-16T12:40:55.265134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":"2209.10652","doi":"10.48550/arxiv.2209.10652","metadata_source":"pith","pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-07-10T13:57:06.883449Z","title":"Toy Models of Superposition","venue":"cs.LG","work_id":"43875dbe-bc2d-4ab5-af63-744411533ff7","year":2022},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d4f4db215c5c97f58940861e3f4ed75ec7ed95c8e9f7e5edeb9718f390881182","observation_id":"63c59359-e099-4ed2-a1cf-13120008844f","resolution":{"observed_at":"2026-05-16T12:40:54.438201Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.681","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:36.744213Z","title":"L ayer S kip: Enabling Early Exit Inference and Self-Speculative Decoding","venue":null,"work_id":"31ebf2f1-9b25-46da-b184-ae5d773ad1ee","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:4d07e2aba2872a79aff0287f0e372f596f2593a21583645370caca10b8c2354f","observation_id":"853dec4d-6688-4195-a653-41033b913f57","resolution":{"observed_at":"2026-05-16T12:40:54.455964Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-11T20:19:07.853648+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T20:19:07.853648+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequential integrated gradients: a simple but effective method for explaining language models","venue":null,"work_id":"3551e796-cef6-422c-a113-79013b1abe42","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:1c0c19f6c144df608533375b2fa23449b90a7f1f779e6aa6b3d6859ec5bf68be","observation_id":"28657cde-7ca5-4740-9376-0e7dfdd84a26","resolution":{"observed_at":"2026-05-16T12:40:55.279072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.477","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"doi: 10.18653/V1/2023.FINDINGS-ACL.477","venue":null,"work_id":"fac13e51-a1f5-4783-bb13-0ff55d6bdf87","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:76d54654546da9092c7b5f346f94e8280638460bc835c9be002f30278e0cca1e","observation_id":"2d394761-3cfe-48ca-8f23-a55c6942bde0","resolution":{"observed_at":"2026-05-16T12:40:54.382085Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How do language models bind entities in context? InNeurIPS 2023 Workshop on Symmetry and Geometry in Neural Representations","venue":null,"work_id":"3166d6dd-e14b-458e-b43c-e87dba2fd323","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:c657ab6f24ae9a0bc393951cab0525aac2baeb107ac1a6475682e49cbc99c689","observation_id":"22ba7b67-c204-42c1-9c00-b1bacbacb0e5","resolution":{"observed_at":"2026-05-16T12:40:55.262958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-07-06T18:08:00.410061Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Ferrando, G","venue":null,"work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:073e769086755c0d88c5e374685caa0e5cf3560899dc667b69092c8f9d0225cb","observation_id":"f53c37eb-ce5e-4382-a38d-c96bc8906a9a","resolution":{"observed_at":"2026-05-16T12:40:54.748973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truthful or fabricated? using causal attribution to mitigate reward hacking in explanations","venue":null,"work_id":"e44d13e7-b879-4659-975b-c957679735fd","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:87dc0af4a288d65c32818fb70d55fb523167f49d1e92c48b5e187067cb0553d3","observation_id":"8f7b7858-ae9e-448d-8bb2-9a307e70af88","resolution":{"observed_at":"2026-05-16T12:40:55.254252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05294","last_updated":"2026-07-07T13:41:32Z","snapshot_observed_at":"2026-07-10T23:18:15.174772Z","submitted_at":"2025-04-07T17:49:23Z","title":"Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations","version":3},"cited_work":{"arxiv_id":"2504.05294","doi":"10.48550/arxiv.2504.05294","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.05294","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2504.05294 , year=","venue":null,"work_id":"93762fed-0338-47df-b0b3-8b4b25e01ac4","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2504.05294","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:e7659d156b8b218e909b2e4642072643f7ae10b712bcae058a9cd34aac76c72e","observation_id":"0c099ec6-1b8d-4e5a-9e3a-f36599310aae","resolution":{"observed_at":"2026-07-08T01:19:05.058075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards empirical in- terpretation of internal circuits and properties in grokked transformers on modular polynomials","venue":null,"work_id":"d726a417-1776-432c-8b34-f5c350785320","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:46e73d967c912cd3461f45ce7345beadc14980baf8d1a25170652188a960bed9","observation_id":"4d41ea08-5f9b-4f65-9175-1cd9316131de","resolution":{"observed_at":"2026-05-16T12:40:55.269639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18878","last_updated":"2025-08-05T20:14:47Z","snapshot_observed_at":"2026-07-06T20:57:52.146394Z","submitted_at":"2025-03-24T16:54:26Z","title":"I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":"2503.18878","doi":"10.48550/arxiv.2503.18878","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18878","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"I have covered all the bases here: Interpreting reasoning features in large language models via sparse autoencoders.arXiv preprint arXiv:2503.18878","venue":null,"work_id":"aef787ce-d831-442a-96cf-e144c4d0af13","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2503.18878","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:a995d4243cf1cc5a0ecaae23ed8bafc7abd70c8ad26944dca5f40278a36a2634","observation_id":"21391415-eafd-450f-be88-ba4f326f41e9","resolution":{"observed_at":"2026-05-16T12:40:54.776198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring mechanistic interpretability in large language models: Challenges, approaches, and insights","venue":null,"work_id":"651e2c6f-bd51-4548-b3f6-2db2863caf60","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d3d85704b02abc0aaf4e8aeabe2055852b7a6f12daed4f54af260708d6a2fce4","observation_id":"767cbfe6-7346-4841-9bb3-15e4df135b01","resolution":{"observed_at":"2026-05-16T12:40:55.364064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.594887Z","title":"H-neurons: On the existence, impact, and origin of hallucination-associated neurons in llms, 2025a","venue":null,"work_id":"6e4961df-b3f0-4ec6-97f5-b2466407c6d1","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:0b6c9c9c24764dfb8d720fd2b16692a5e58d2457ab6ca4f55edefb9875188160","observation_id":"613023b2-0332-4556-abf4-32e099bf75ae","resolution":{"observed_at":"2026-05-16T12:40:54.751842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":"2406.04093","doi":"10.48550/arxiv.2406.04093","metadata_source":"pith","pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-07-10T06:36:52.592379Z","title":"Scaling and evaluating sparse autoencoders","venue":"cs.LG","work_id":"f3faddeb-36ed-42bc-a7c9-9e764dc9b368","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:77cc9054c4bb46a31a67c6ec5ee7a171f06dc42dd43a8fc9e9b4cb01c28d71ea","observation_id":"a1cee848-2c73-4a80-966d-55c29f412b01","resolution":{"observed_at":"2026-05-16T12:40:54.764524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13653","doi":"10.48550/arxiv.2511.13653","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2511.13653 , year =","venue":null,"work_id":"012dbb2b-bb80-42ff-bfef-d95637ba178b","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:2b8ce2e2091da6deb81ef09590817ab001f2b10fb21792664788bcc404da9ded","observation_id":"df0237b3-4bba-4170-b871-54d19243dbd3","resolution":{"observed_at":"2026-05-16T12:40:54.734453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causal abstraction: A theoretical foundation for mechanistic interpretability.Journal of Machine Learning Research, 26(83): 1–64","venue":null,"work_id":"e56548fa-3000-49cf-9ae0-36caac70474d","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:9274b165918ca9e4942738fb72149f430d78ecb7839373b326d427d682ec811d","observation_id":"f15120e8-67ea-48cf-9aeb-e5471e5ab46f","resolution":{"observed_at":"2026-05-16T12:40:55.240093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":"c638c62f-b785-4cac-a3e5-85009174ad59","year":2021},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:142641c2ca708e96a6b23e19e12f6211e68bbb208ff2926b3947bf13f2ec0555","observation_id":"276e03b2-7e04-4798-9558-106cf3705411","resolution":{"observed_at":"2026-05-16T12:40:55.231918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-07-06T10:28:37.759799Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":"2012.14913","doi":"10.18653/v1/2021.emnlp-main.446","metadata_source":"pith","pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","venue":"cs.CL","work_id":"af95ed34-d603-4b8d-b5d5-582dd09e9938","year":2020},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:06f26b95c69fe670b76e6fef088d87a9a13b37b5e4a26fc740ba1781808a5620","observation_id":"aed21c0f-0ec6-43ae-8a92-d60d3acb0c75","resolution":{"observed_at":"2026-05-16T12:40:54.465938Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:17.131891+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:17.131891+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:50:35.822769Z","title":"Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space","venue":null,"work_id":"c7a1a3ad-dd11-4bfb-94f4-77f88ca5bc37","year":2022},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:7ce10c0fa1c51e04aa1c4e67b0dd4d160dd6d5d221d498caec51ed4ca1cf8dc2","observation_id":"5a5661d1-8ecf-4426-b94d-51cce1626c26","resolution":{"observed_at":"2026-05-16T12:40:55.207204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.751","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:27:18.343983Z","title":"Dissecting","venue":null,"work_id":"e55a6dfe-ace0-4eb3-a380-e0e1acec4912","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:c5006c75e5a3b87d72f5fda0cfec3ebe0348ab1aeb21a49c7f2e3af8dd790b82","observation_id":"e1aa706f-f292-4c8a-9362-fe302f782b30","resolution":{"observed_at":"2026-05-16T12:40:54.490914Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:22:30.219104+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:22:30.219104+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-4002","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lepori, and Lucas Dixon","venue":null,"work_id":"7881ee3f-2203-4cd0-b9f9-051028e06746","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:4c88ab7119b3d99702caeffe55e4db5c0af28d4d80b1e6441f75c989158d75e6","observation_id":"5d28194c-ee2d-4f58-b964-8b7718b3c119","resolution":{"observed_at":"2026-05-16T12:40:54.429361Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.21508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient training of sparse autoencoders for large language models via layer groups","venue":null,"work_id":"64b837e1-3d9f-4222-bb0b-4a08c7d5b889","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:a78aed3e0139959975a730aac220a0910cd9eb9ece73fa706bd5bdf2b049e13a","observation_id":"d90cc237-7913-4e1c-b673-bf7524a82bb1","resolution":{"observed_at":"2026-05-16T12:40:54.685616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05969","last_updated":"2023-05-16T16:24:55Z","snapshot_observed_at":"2026-07-06T15:14:55.628493Z","submitted_at":"2023-04-12T16:46:43Z","title":"Localizing Model Behavior with Path Patching","version":2},"cited_work":{"arxiv_id":"2304.05969","doi":"10.48550/arxiv.2304.05969","metadata_source":"pith","pith_arxiv_id":"2304.05969","snapshot_observed_at":"2026-07-10T09:06:59.172029Z","title":"Localizing Model Behavior with Path Patching","venue":"cs.LG","work_id":"fdd07939-8060-4e9e-bd06-ff125eae86ef","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2304.05969","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:2e1349695b5adbb88d4d348b3850c1d52b24ec437de111577e66acb2a8dd09e8","observation_id":"61dcf6bb-62cd-4267-b15f-76211035cd59","resolution":{"observed_at":"2026-05-16T19:38:37.891054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-05-20T06:52:29.533674+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T06:52:29.533674+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking Bad Tokens: Detoxification of LLMs Using Sparse Autoencoders","venue":null,"work_id":"9949770f-c6ec-4e6d-a736-eef240f01e21","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d0bfdd4e4fbd8a2faf2fed793904c06ecbfb50d48529b23318e893a5b86712b9","observation_id":"934145fe-623f-4d38-8f92-e2100624f98a","resolution":{"observed_at":"2026-05-16T12:40:55.305390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Executive control emerging from dynamic interactions between brain systems mediating language, working memory and attentional processes.Acta psychologica, 115(2-3):105–121","venue":null,"work_id":"16c0de21-6d3c-478a-817e-6a8c407039ae","year":2004},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:329ee87b973d53bb8d0d74a0cd329841dbc6161d16541a1592be7c3dbd0d1cdf","observation_id":"5bc70be2-ee54-4221-9703-32f00af853c5","resolution":{"observed_at":"2026-05-16T12:40:55.251518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer","venue":null,"work_id":"daa61a6e-d1b2-4ede-bddc-48b0d3b5409d","year":2010},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d69b058347d33047457fd7e31f0b73bf9d8bcc9dfb3ff5f99b7efb7bf8fd7fec","observation_id":"774a30eb-1798-4769-88d8-75549f940c61","resolution":{"observed_at":"2026-05-16T12:40:55.253352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion, July 2025","venue":null,"work_id":"5ddb8b87-6fad-4d70-8165-9f91f31ef286","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:65a4b9360e73c4f4231eb58199c411b3dea6148885370d1de0fb590f44003e74","observation_id":"8ffc0ded-9f7c-487d-9a4b-f374f6efbe6d","resolution":{"observed_at":"2026-05-16T12:40:55.269342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention score is not all you need for token importance indicator in KV cache reduction: Value also matters","venue":null,"work_id":"a3ef2df0-26f6-41ea-8c66-3b4e8fd3745a","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:e285d1fe34f85649041f0afd2debcb9a2c1758122960d1cec16e8b4b6c8634f3","observation_id":"97b81712-b155-4995-b81a-ac97c727c6ce","resolution":{"observed_at":"2026-05-16T12:40:55.263684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1178","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:22:03.016813Z","title":"doi: 10.18653/v1/2024.emnlp-main.1178","venue":null,"work_id":"d90f1ecf-f364-421c-a5b4-d9210bb1607e","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:ce885c922f4765701ad52923f68ae23baa8a9d05dbcb74d7b47bf0b4d871ad7a","observation_id":"4ac3630f-4119-4b61-b32c-7aca182d061c","resolution":{"observed_at":"2026-05-16T12:40:54.341029Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08319","last_updated":"2025-05-29T15:26:06Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:53:00Z","title":"Enhancing Automated Interpretability with Output-Centric Feature Descriptions","version":2},"cited_work":{"arxiv_id":"2501.08319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08319","snapshot_observed_at":"2026-07-04T14:19:53.882248Z","title":"Enhancing automated interpretability with output-centric feature descriptions","venue":null,"work_id":"9e054990-b2ed-450a-84a6-990bb4bbc7d3","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2501.08319","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:62ee3a6258ebee1a845e61ba639eda83a2de473c6bb3d26b5bcadd1dfb0ef348","observation_id":"89e1260c-d73b-43b5-be0e-a84974de6c3f","resolution":{"observed_at":"2026-05-16T12:40:54.644671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.22608","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language arithmetics: Towards systematic language neuron identification and manipulation, 2025a","venue":null,"work_id":"8d0b1a90-2e13-4cb7-bd7f-b0c8246da92f","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:06ec02f265a56a9be63f0b91dafc2d0820338707a7bdcec2238ccca47e1a6d46","observation_id":"a0968755-b832-452d-ab3f-81cb198ef015","resolution":{"observed_at":"2026-05-16T12:40:54.678948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13580","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse subnetwork enhancement for underrepresented languages in large language models, 2025b","venue":null,"work_id":"961c2f0f-70ba-4eb2-9ba5-22709bc3dcaa","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:0dfd65e281e3c48a8c6cdd3488adb73809ea2373e13f70c64ae9b011700a1bad","observation_id":"fa410992-5c92-4e0d-a675-2bbb5b4451f9","resolution":{"observed_at":"2026-05-16T12:40:54.687163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Position-aware automatic circuit discovery","venue":null,"work_id":"685d3809-ea93-4079-a2ed-a5933aabdbc2","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d8596f4eea6242e3bf676d004fb8af8853c31408b94eb0ef2c4a9d460fb12f61","observation_id":"d7c46cd2-1dab-4bc4-b9e8-c0eb03c7be8e","resolution":{"observed_at":"2026-05-16T12:40:55.307219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Personality as a probe for LLM evaluation: Method trade-offs and downstream effects","venue":null,"work_id":"7978f8ee-e481-48cb-87fa-2172376c037d","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:bdb0278439af32ea600f8ef6acbdfc37c09f0a9f1e74b21081648230c4b106ae","observation_id":"a0dd5fc3-f7b4-4594-8d37-1208735d6ef5","resolution":{"observed_at":"2026-05-16T12:40:55.173531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How does GPT-2 compute greater- than?: Interpreting mathematical abilities in a pre-trained language model","venue":null,"work_id":"23c36a9f-108c-4aff-bcd7-8bbe91d5d13e","year":2023},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:9223497a225367e07a92e4a205a28c5309608d49f618eb088ff2e085f4cb9a38","observation_id":"3683568c-69a2-4534-b437-d5fd8b16c0c8","resolution":{"observed_at":"2026-05-16T12:40:55.291833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Have faith in faithfulness: Going beyond circuit overlap when finding model mechanisms","venue":null,"work_id":"2a6f7718-1739-4923-8e52-8e798a8ecd40","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:8b0c27eb236589e15ffe703feff85a447649d939287d96ebe146865adf955920","observation_id":"64bba6bb-41fa-4607-a5a6-196605aeaacf","resolution":{"observed_at":"2026-05-16T12:40:55.177323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Circuit-tracer: A new library for finding feature circuits","venue":null,"work_id":"65142399-2111-4222-9cde-9a9cb2259d6c","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:fe66d3e484f72f63797bf020532f2b695f3d35c3ddbcc6d8d7eaa954d0b55bb4","observation_id":"3707dda1-8e1f-45ae-a0a2-05f09f74656f","resolution":{"observed_at":"2026-05-16T12:40:55.287076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification.Advances in Neural Information Processing Systems, 37:68287–68307, 2024a","venue":null,"work_id":"4c6a7ec8-fc58-4cd6-874c-7ae54573458f","year":null},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:c61f0a4d3025cedccfe72154c8b2726eb0bee0323f7c0c70f8e132f3763252d4","observation_id":"e91c411a-0f95-4893-85e6-801ec1eaa9e2","resolution":{"observed_at":"2026-05-16T12:40:55.177624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":0,"verified_exact":46,"verified_fuzzy":45},"total_outbound_references":293},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 100 of 293 outbound references and 15 inbound Pith citation observations for arXiv:2601.14004."}