{"as_of":"2026-08-08T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0728ca389b3c003bd371d49f043188dbbd541cda4194548d94ad6dc4a727d3e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:27:20.702277Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T15:30:22.282961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15038","last_updated":"2025-07-29T21:40:42Z","snapshot_observed_at":"2026-08-07T21:57:25.528811Z","submitted_at":"2025-05-21T02:45:11Z","title":"Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:22.282961Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.15038"},"observation_digest":"sha256:4b9b74d8355d8156e5d9e39131a9bdf2ab3a69e3f53b9dcbe723001ccf2e036b","observation_id":"7a9fc4e6-95b4-4fb6-a4ba-502bb7e25f20","resolution":{"observed_at":"2026-08-07T15:30:22.282961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T15:01:51.732241Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16612","last_updated":"2025-10-14T08:28:41Z","snapshot_observed_at":"2026-08-08T06:16:44.202411Z","submitted_at":"2025-05-22T12:47:16Z","title":"Steering Large Language Models for Machine Translation Personalization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:01:51.732241Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.16612"},"observation_digest":"sha256:91de5d99b3ba0e3e971a24e1388f892c31b4785a72111d89196d54579f757950","observation_id":"31cea893-d830-4649-a4bb-38ba2a5f3b78","resolution":{"observed_at":"2026-08-07T15:01:51.732241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T14:20:58.857369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19333","last_updated":"2025-05-25T21:40:26Z","snapshot_observed_at":"2026-08-07T14:14:16.527884Z","submitted_at":"2025-05-25T21:40:26Z","title":"Evaluating Steering Techniques using Human Similarity Judgments","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:58.857369Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.19333"},"observation_digest":"sha256:8a535c59b4bad471e4ea38d19fc570685cd0aafeca695465625c67b687d14f1c","observation_id":"f67b55c0-fde2-4415-afdd-9906c7cd1c92","resolution":{"observed_at":"2026-08-07T14:20:58.857369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T13:51:33.503653Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20809","last_updated":"2025-05-27T07:16:40Z","snapshot_observed_at":"2026-08-07T21:54:12.571328Z","submitted_at":"2025-05-27T07:16:40Z","title":"Improved Representation Steering for Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:51:33.503653Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.20809"},"observation_digest":"sha256:12d0ba9d35b5516039c7a5ebfd0baa43c3f0fa04654e555dcf08c69adb7307b6","observation_id":"0bbd5b28-16ef-422c-85fd-6ec1fde77f96","resolution":{"observed_at":"2026-08-07T13:51:33.503653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T12:13:19.564287Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00253","last_updated":"2025-06-08T23:37:10Z","snapshot_observed_at":"2026-08-07T21:55:20.181434Z","submitted_at":"2025-05-30T21:41:44Z","title":"Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:19.564287Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.00253"},"observation_digest":"sha256:7ef65c9f3dd3b255f8f41998d7a138224472239938c4d020880fd5cd927e765b","observation_id":"23e4f887-4e7a-45ad-ad63-9c1688b592c9","resolution":{"observed_at":"2026-08-07T12:13:19.564287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T12:07:11.939328Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00653","last_updated":"2025-06-04T19:24:26Z","snapshot_observed_at":"2026-08-07T21:56:54.609521Z","submitted_at":"2025-05-31T17:45:18Z","title":"Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:11.939328Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.00653"},"observation_digest":"sha256:7cbc50ea0016bb983348aaee32d19b98df0875ff695214f0c7dbb9158c559d3b","observation_id":"a44a648d-3daf-4ca6-80dc-25d7bcf6f345","resolution":{"observed_at":"2026-08-07T12:07:11.939328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T11:11:19.096812Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03292","last_updated":"2025-06-03T18:32:01Z","snapshot_observed_at":"2026-08-07T21:57:37.609091Z","submitted_at":"2025-06-03T18:32:01Z","title":"HyperSteer: Activation Steering at Scale with Hypernetworks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:11:19.096812Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.03292"},"observation_digest":"sha256:b83b95de451e8e57a56de5774ffb53e01d1f2694f7f995f58c3ce2815732b27a","observation_id":"de4cbd8d-1c7a-408d-9bbd-93ecc67f2526","resolution":{"observed_at":"2026-08-07T11:11:19.096812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T10:40:16.702496Z","title":"D.; and Potts, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04774","last_updated":"2025-06-05T09:06:59Z","snapshot_observed_at":"2026-08-07T13:35:59.954309Z","submitted_at":"2025-06-05T09:06:59Z","title":"Fine-Grained Interpretation of Political Opinions in Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:40:16.702496Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.04774"},"observation_digest":"sha256:c9d8480601b44b8a66e454a49af5100e4fb2aceccb4cb525ff8da5e993f1a020","observation_id":"8f410453-9292-436c-a201-524a7700f897","resolution":{"observed_at":"2026-08-07T10:40:16.702496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T04:45:42.741450Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09967","last_updated":"2025-06-13T18:01:49Z","snapshot_observed_at":"2026-08-08T04:42:45.653107Z","submitted_at":"2025-06-11T17:44:01Z","title":"Resa: Transparent Reasoning Models via SAEs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:42.741450Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.09967"},"observation_digest":"sha256:c4653844dab3c71c28c1e4791b4ba6c4b0db790944a69e6820e3ce0f6f6aa79d","observation_id":"48448f35-3dc6-4cb3-b0e2-fd117fefe50a","resolution":{"observed_at":"2026-08-07T04:45:42.741450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T01:03:41.633267Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12217","last_updated":"2025-06-13T20:40:13Z","snapshot_observed_at":"2026-08-08T08:37:37.017827Z","submitted_at":"2025-06-13T20:40:13Z","title":"From Emergence to Control: Probing and Modulating Self-Reflection in Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T01:03:41.633267Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.12217"},"observation_digest":"sha256:55f236c15193af44dd3994695b26c1d147b1449559399a941f13aed591e4d578","observation_id":"aa3cfd68-4461-42d7-9c7b-067819b1df5e","resolution":{"observed_at":"2026-08-07T01:03:41.633267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-06T21:34:33.631283Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23845","last_updated":"2026-07-04T18:58:34Z","snapshot_observed_at":"2026-08-06T22:02:24.950097Z","submitted_at":"2025-06-30T13:35:56Z","title":"Position: Use Sparse Autoencoders to Discover Unknowns","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:33.631283Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.23845"},"observation_digest":"sha256:c508c4b21782bf4eb0bde94493c5c6f8120c796b419620e31e431e3822b58310","observation_id":"686e0ed0-7129-44b5-add7-9373dae8b45e","resolution":{"observed_at":"2026-08-06T21:34:33.631283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-06T16:40:44.637794Z","title":"D., and Potts, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12950","last_updated":"2025-07-18T09:19:19Z","snapshot_observed_at":"2026-08-08T08:02:10.889574Z","submitted_at":"2025-07-17T09:43:20Z","title":"Insights into a radiology-specialised multimodal large language model with sparse autoencoders","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:40:44.637794Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2507.12950"},"observation_digest":"sha256:0c0d41cff7c12de2856eefd0d77a3b4d1b6b770f6b380510011bdf7cbc6324bb","observation_id":"ecec1d06-3b49-41fc-859c-0a010f994c08","resolution":{"observed_at":"2026-08-06T16:40:44.637794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T17:18:55.749890Z","title":"Zhengxuan Wu, Aryaman Arora, Atticus Geiger, Zheng Wang, Jing Huang, Dan Jurafsky, Christo- pher D Manning, and Christopher Potts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16560","last_updated":"2026-07-07T00:22:17Z","snapshot_observed_at":"2026-08-05T17:18:51.196119Z","submitted_at":"2025-08-22T17:26:33Z","title":"Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:18:55.749890Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2508.16560"},"observation_digest":"sha256:5a1774b1c1090fa093027fc5589973f2f75dfb03c61d8c881bab1a17924bbca7","observation_id":"5f90aaef-7103-4c7f-a616-dc6de6694890","resolution":{"observed_at":"2026-08-05T17:18:55.749890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T18:47:45.341219Z","title":"URL https://arxiv.org/abs/2501.17148","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-05T18:44:01.835548Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.341219Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:215fbe75ec45204b2a03fcc7627c67a1ef9375c9519c119bc1ad1fc02ddefe7a","observation_id":"3d6046e9-9891-47b7-b248-19a4ac46b9a4","resolution":{"observed_at":"2026-08-05T18:47:45.341219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-04T22:18:44.791907Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09715","last_updated":"2025-09-09T05:50:08Z","snapshot_observed_at":"2026-08-07T09:17:17.664367Z","submitted_at":"2025-09-09T05:50:08Z","title":"Investigating Symbolic Triggers of Hallucination in Gemma Models Across HaluEval and TruthfulQA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:18:44.791907Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2509.09715"},"observation_digest":"sha256:828296f0f3c58b30b53dfed2865602127e1cec8966ac7a18d2c50b3c7c18f768","observation_id":"64bae72e-6f2d-45e3-a86e-bcd48d11aca8","resolution":{"observed_at":"2026-08-04T22:18:44.791907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-04T13:45:27.597133Z","title":"Axbench: Steering llms? even simple baselines outper- form sparse autoencoders.arXiv preprint arXiv:2501.17148,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25533","last_updated":"2026-07-06T05:00:34Z","snapshot_observed_at":"2026-08-06T23:26:32.833872Z","submitted_at":"2025-09-29T21:43:18Z","title":"VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:45:27.597133Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2509.25533"},"observation_digest":"sha256:d20a9d060f0db1916f6dab889b00678684dee57b169a8541a5b653b04fdae203","observation_id":"fef9a84f-9bd2-402d-979e-78f556efb848","resolution":{"observed_at":"2026-08-04T13:45:27.597133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-03T18:33:09.003812Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05038","last_updated":"2026-05-29T17:42:38Z","snapshot_observed_at":"2026-08-07T15:13:01.011752Z","submitted_at":"2025-12-04T17:55:55Z","title":"The SuperActivator Mechanism: Transformers Concentrate Reliable Concept Signals in the Tail","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T18:33:09.003812Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2512.05038"},"observation_digest":"sha256:9cbbf79739476518509a003b786c0617953ed6a4802e0b6217012bd288210337","observation_id":"6a29067e-97b4-4317-a117-068745e3b2cc","resolution":{"observed_at":"2026-08-03T18:33:09.003812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.05715","last_updated":"2026-05-07T05:58:38Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:58:38Z","title":"Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-08T11:42:16.090162Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.05715"},"observation_digest":"sha256:671baca6dabff1a3ec217cc7de3c4df336d59629ca40cd89cff4d1e1271a4960","observation_id":"25cc1439-9855-45b6-90e2-52c1d205dc7e","resolution":{"observed_at":"2026-05-11T19:31:10.587655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-03T01:46:27.665738Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:06.234399Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:fc7e70d10781a0267e3da13a5d6c9d785c14eaefc72c3ad2887679197be5c144","observation_id":"999f74ea-7573-496a-b670-863bce46d67f","resolution":{"observed_at":"2026-05-12T00:51:15.332661Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-03T01:46:27.665738Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T21:21:37.185232Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:fb5b19f2ac23a9ad382817bb5743896a9432dcb183b8b11bfc9975afe1c34dc7","observation_id":"c9542428-9d16-464c-9340-0a67098a26b5","resolution":{"observed_at":"2026-05-14T21:22:58.969437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-03T01:46:27.665738Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T17:06:03.483247Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:7c4a55052d6ed367f142d3cedc442bcd449c20babdb6d7faae7a6704f5ed3c02","observation_id":"cbcdd5f3-9ca9-4d3e-921f-0895e37a543a","resolution":{"observed_at":"2026-05-19T17:07:41.693739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-03T01:46:27.665738Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:41:36.199099Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:ca904935e4bb2fd2c247c1e76354e12f4e7ac587b63b93ca5d921cdf34e3c9e9","observation_id":"dc19f809-2c50-4736-a7d6-263c18fb155f","resolution":{"observed_at":"2026-06-30T23:45:08.055382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.10601","last_updated":"2026-05-11T14:02:56Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:02:56Z","title":"The Open-Box Fallacy: Why AI Deployment Needs a Calibrated Verification Regime","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T03:37:12.567351Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.10601"},"observation_digest":"sha256:4b4d6fd743222bc8b95495bd12ffce03f74859d153b133dbf70b570272601baa","observation_id":"cf6380e4-61c1-493d-9226-07ebcd27f71b","resolution":{"observed_at":"2026-05-12T07:11:26.524548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:3eceac22dd579a41a6661fdc8163705035768866d2d5a2980a74b2a51f1efb41","observation_id":"03000c2e-bb75-415a-8a01-5338990b0c2b","resolution":{"observed_at":"2026-05-13T05:22:18.867569Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T07:46:41.159688Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:ea046e092439cb1a46aa44e1ff5a368f36bfb7af19250f25854b07c75a1a9a12","observation_id":"5273eeed-d53c-4b66-aa4e-adcbe3a4aacb","resolution":{"observed_at":"2026-05-21T07:49:50.175124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T22:36:12.466550Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:a23dc3d521b1e07abd884f30bc5f3193591176f596d2c7613641ebcee6aecffd","observation_id":"d5d1b455-8957-4939-afef-686d00f5552e","resolution":{"observed_at":"2026-05-20T22:39:10.652456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:59:32.201925Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:049916784c5213050e57295677b005764af92436a0ab80088976b90293b94bc9","observation_id":"420f821d-c186-40f2-8e77-c80e1bd8075a","resolution":{"observed_at":"2026-05-22T10:01:23.537374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.18229","last_updated":"2026-05-18T11:20:57Z","snapshot_observed_at":"2026-08-02T06:59:50.853862Z","submitted_at":"2026-05-18T11:20:57Z","title":"Are Sparse Autoencoder Benchmarks Reliable?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T12:43:13.014365Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.18229"},"observation_digest":"sha256:efad9a67f5d4e3b96c9c5e5e025799b3321ecdae870d086f17b038696ebf9f9f","observation_id":"037a966f-e60b-465f-aa09-3c95ed64ef6f","resolution":{"observed_at":"2026-05-20T12:43:16.805970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.28664","last_updated":"2026-05-27T15:59:45Z","snapshot_observed_at":"2026-08-07T19:59:30.749922Z","submitted_at":"2026-05-27T15:59:45Z","title":"Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T13:53:27.306664Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.28664"},"observation_digest":"sha256:090ec09594536feba9688d6dc7a7b31e064ed94fdc4c2715e59d6ba786d31830","observation_id":"f63048b1-1502-4a22-91ff-0f9842ba83ec","resolution":{"observed_at":"2026-06-29T14:03:29.907469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:ebaba8c01fa2714ae5a6443265024a4a7e6f0b2085abf311ea50a126a949c420","observation_id":"8e55ea6d-c6f2-4dd1-a1a5-9344dddd060a","resolution":{"observed_at":"2026-07-01T14:05:47.199446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"AxBench: Steering LLMs? even simple baselines outperform sparse autoencoders.arXiv preprint arXiv:2501.17148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:8a01783e0daaa0a5cf3ebd8da2e03ef01e5e316500f21df3c46354e0607864d1","observation_id":"1b40c27b-9c83-451e-bbbd-1341a9ee321f","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.11599","last_updated":"2026-06-10T02:55:34Z","snapshot_observed_at":"2026-08-05T14:08:13.079183Z","submitted_at":"2026-06-10T02:55:34Z","title":"When is Your LLM Steerable?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T10:01:21.682285Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.11599"},"observation_digest":"sha256:06d6f73b7142672d75d6beab791198e80d509ffc69297cd9c16a28f28ad94747","observation_id":"e3ba96c8-ca5b-4522-8973-6c0e25c6d87e","resolution":{"observed_at":"2026-07-03T10:27:56.578484Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.12360","last_updated":"2026-06-10T17:31:16Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:31:16Z","title":"Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-06-27T10:32:57.295159Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.12360"},"observation_digest":"sha256:d1f149f6d1bb8d84d875acb62a29321dbe6270d591249c42e52d060bf5c460bc","observation_id":"e79bbe08-8e29-4e61-8e50-6f9acde5ce5b","resolution":{"observed_at":"2026-07-03T09:07:47.864621Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.15054","last_updated":"2026-06-29T22:04:02Z","snapshot_observed_at":"2026-08-03T01:16:15.417885Z","submitted_at":"2026-06-13T01:51:05Z","title":"Size Doesn't Matter: Cosine-Scored Sparse Autoencoders","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T07:15:16.674714Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.15054"},"observation_digest":"sha256:ffeba5225f95773a117a2c5abcdf62e03c356b7856d7de48f1b577e0cd4da048","observation_id":"71cc1d01-e169-4ee8-bfb5-708a7379f935","resolution":{"observed_at":"2026-07-01T07:15:29.624121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-01T20:58:54.009938Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16448","last_updated":"2026-07-17T18:47:31Z","snapshot_observed_at":"2026-08-07T21:54:41.817874Z","submitted_at":"2026-07-17T18:47:31Z","title":"Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T20:58:54.009938Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2607.16448"},"observation_digest":"sha256:e5061623b34b9e0bcdbe0dfcd1ef4b9ceba1b4d15c3e94c5c708f16901a91f63","observation_id":"67b37175-3b56-4910-984d-8f416ca019f6","resolution":{"observed_at":"2026-08-01T20:58:54.009938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-02T13:56:50.382262Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18259","last_updated":"2026-05-15T15:34:48Z","snapshot_observed_at":"2026-08-08T01:48:17.759173Z","submitted_at":"2026-05-15T15:34:48Z","title":"Probabilistic Concept-Aware Steering for Trustworthy LLM Inference","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-02T13:56:50.382262Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2607.18259"},"observation_digest":"sha256:9fa68a69c30b54cf47a3d55fa72ea8928c7f419ca944a5e52a658f72c4eeef96","observation_id":"608fb2c6-208f-4036-b5af-45253a520b6a","resolution":{"observed_at":"2026-08-02T13:56:50.382262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-06T22:56:06.016314Z","title":"arXiv preprint arXiv:2501.17148 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04524","last_updated":"2026-08-05T06:56:58Z","snapshot_observed_at":"2026-08-08T08:12:05.298414Z","submitted_at":"2026-08-05T06:56:58Z","title":"ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:56:06.016314Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2608.04524"},"observation_digest":"sha256:a1caf3c42139fa93e2af67b3bceef96df5535439aa8a9bd07a6897c96caad072","observation_id":"c2b9c053-81bb-4ef3-8471-255f8b679817","resolution":{"observed_at":"2026-08-06T22:56:06.016314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-08T00:27:20.702277Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05732","last_updated":"2026-08-06T08:17:50Z","snapshot_observed_at":"2026-08-08T08:17:07.034336Z","submitted_at":"2026-08-06T08:17:50Z","title":"CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:27:20.702277Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2608.05732"},"observation_digest":"sha256:74e6adb7626ebf2636a96f3dc6ac4fc620c53c4cbde68585fe8e06425ab4a713","observation_id":"52a1fa14-295f-46b4-87ae-5d6cc4258b0b","resolution":{"observed_at":"2026-08-08T00:27:20.702277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.17148/citation-record","integrity":"/paper/2501.17148/integrity","json":"/paper/2501.17148/citation-record.json","paper":"/paper/2501.17148"},"outbound":[],"paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:53:39.823463Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2501.17148."}