{"as_of":"2026-08-21T06:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b11ef7d079d02fc8f375ccdef20db391da022afbbf6e4d30c808a4c222c3865","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:03.819990Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-04T17:01:39.362411Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:09:58.298491Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"cited_work":{"arxiv_id":"2505.20254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20254","snapshot_observed_at":"2026-07-04T17:09:58.298491Z","title":"uncertainty in interpreting these numbers","venue":null,"work_id":"71c4c12b-a975-4bef-ac62-21e07a6da444","year":2025},"citing_paper":{"arxiv_id":"2512.06655","last_updated":"2026-05-15T09:56:17Z","snapshot_observed_at":"2026-08-16T12:48:19.183589Z","submitted_at":"2025-12-07T04:46:30Z","title":"Graph-Regularized Sparse Autoencoders for LLM Safety Steering","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T18:39:02.687301Z"},"links":{"cited_paper":"/paper/2505.20254","citing_paper":"/paper/2512.06655"},"observation_digest":"sha256:fdb204d30eba08efd55fb36348ac2dec8b26c29b23fae81c9d69b185a00cfc71","observation_id":"29fe38af-348b-4e31-95a9-11839d546684","resolution":{"observed_at":"2026-05-21T18:40:28.916617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"cited_work":{"arxiv_id":"2505.20254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20254","snapshot_observed_at":"2026-07-04T17:09:58.298491Z","title":"uncertainty in interpreting these numbers","venue":null,"work_id":"71c4c12b-a975-4bef-ac62-21e07a6da444","year":2025},"citing_paper":{"arxiv_id":"2606.00033","last_updated":"2026-04-24T17:42:31Z","snapshot_observed_at":"2026-08-13T08:50:53.495432Z","submitted_at":"2026-04-24T17:42:31Z","title":"Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-04T17:01:39.362411Z"},"links":{"cited_paper":"/paper/2505.20254","citing_paper":"/paper/2606.00033"},"observation_digest":"sha256:0c5225c56f1c4ffb7df3833be210a753b7d4314a1eb6ae3c1b8d1afb5f68b6f1","observation_id":"bab755f3-6fa3-47e9-87e4-fef0bc161a45","resolution":{"observed_at":"2026-07-04T17:09:58.300413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20254/citation-record","integrity":"/paper/2505.20254/integrity","json":"/paper/2505.20254/citation-record.json","paper":"/paper/2505.20254"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.03032","last_updated":"2025-03-04T22:19:52Z","snapshot_observed_at":"2026-08-18T08:32:25.669981Z","submitted_at":"2025-03-04T22:19:52Z","title":"SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03032","snapshot_observed_at":"2026-08-07T14:02:58.487711Z","title":"Safe: A sparse autoencoder-based framework for robust query enrichment and hallucination mitigation in llms.arXiv preprint arXiv:2503.03032, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:58.487711Z"},"links":{"cited_paper":"/paper/2503.03032","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:69d745b6ee145c450a04f1d1722739c82b507d822c725c3c6f79b9799f11f27f","observation_id":"d985f89e-c3d7-481f-bcb8-a67ba9aeba66","resolution":{"observed_at":"2026-08-07T14:02:58.487711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.591219Z","title":null,"venue":null,"work_id":"3533f079-c74a-43f9-8a02-69bd2ea9c6ad","year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:58.567689Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:2c7a63f5ec43c55c69073bfb7e1cc082d674112b052043248f0c3a17d1bf89fc","observation_id":"84fc0e70-98a5-443c-a3cd-cbfa08c00f8f","resolution":{"observed_at":"2026-08-07T14:03:08.646727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.726604Z","title":"New algorithms for learning incoherent and overcomplete dictionaries","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:58.726604Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:22cca34e1a1413cc7b17d3da6a6c2570ebfe6ad18037f2231557d8a1e6bc7a1f","observation_id":"645c8277-9cca-4b46-8479-21efa3b5726c","resolution":{"observed_at":"2026-08-07T14:02:58.726604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.441799Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"afe88d87-6e69-4a25-b876-49996b1d1752","year":2023},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:58.750981Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:1afe772e509b93f9bf31447a6c456ceaf15ccc6a114e6dc355448a461fd034ab","observation_id":"34c35eff-2e77-4f2d-a7b9-d27f17667d93","resolution":{"observed_at":"2026-08-07T14:03:08.494837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.306074Z","title":"Turner, Cem Anil, Carson Denison, Amanda Askell, et al","venue":null,"work_id":"739dfdff-0608-40c2-bd59-eafea1582e01","year":2023},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:58.823522Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:824d50499024f9ec319baaa908d8672f75795bad13dc7c356027b4e80261b4f6","observation_id":"d388b3e2-e670-49b7-8ca1-79094ac30591","resolution":{"observed_at":"2026-08-07T14:03:08.359800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.170912Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning","venue":null,"work_id":"db703bb4-04b5-4912-a713-52c4619a7c56","year":2023},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:58.921893Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:49f84d2ba5a63925a212a1598b9925ba6baa2105c8ff421a0a040057018cf49e","observation_id":"e0457bd2-f38e-4f23-a0f5-9e841a08dcc5","resolution":{"observed_at":"2026-08-07T14:03:08.219243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06410","last_updated":"2024-12-09T11:39:00Z","snapshot_observed_at":"2026-08-20T16:31:53.975704Z","submitted_at":"2024-12-09T11:39:00Z","title":"BatchTopK Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06410","snapshot_observed_at":"2026-08-07T14:02:58.976794Z","title":"Batchtopk sparse autoencoders.arXiv preprint arXiv:2412.06410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:58.976794Z"},"links":{"cited_paper":"/paper/2412.06410","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:7cec44603c98ff7340e385aaafbc9c4d10dd469a0192c89f9c534a66035688dc","observation_id":"6a38c3d4-af46-42a5-87b0-f690c11b3c21","resolution":{"observed_at":"2026-08-07T14:02:58.976794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17547","last_updated":"2025-03-21T21:43:28Z","snapshot_observed_at":"2026-08-20T04:36:22.947040Z","submitted_at":"2025-03-21T21:43:28Z","title":"Learning Multi-Level Features with Matryoshka Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17547","snapshot_observed_at":"2026-08-07T14:02:59.051713Z","title":"Learning multi-level features with matryoshka sparse autoencoders.arXiv preprint arXiv:2503.17547, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.051713Z"},"links":{"cited_paper":"/paper/2503.17547","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:057d7d92241ec403d7e10c3e8f9c21d9b11cf1344b4418c2e63ad7db8ddedf7c","observation_id":"4f48c707-9311-4ae1-a416-49bbd095833e","resolution":{"observed_at":"2026-08-07T14:02:59.051713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T14:02:59.154435Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.154435Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:84774141875a15d1f4d894fe912c0d663d5f0b478d47836471ca9dcf4f7fb3aa","observation_id":"d04aa17b-e3fd-4de2-a6cf-85e93322aba3","resolution":{"observed_at":"2026-08-07T14:02:59.154435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.217821Z","title":"A is for absorption: Studying feature splitting and absorption in sparse autoencoders.arXiv preprint arXiv:2409.14507, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.217821Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:6ff91d54b76e6d955b380179581fc656642f0dcee30c5049506a754c01b325f9","observation_id":"1363a7c9-9a08-4aba-8d9a-1e8ee822cd3a","resolution":{"observed_at":"2026-08-07T14:02:59.217821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-16T13:37:26.527260Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-07T14:02:59.277009Z","title":"Sparse autoen- coders find highly interpretable features in language models.arXiv preprint arXiv:2309.08600, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.277009Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:bd52ea2673f358b3ccbf70d2bdea2c2cd4234b2ca24362a0a6e0459a89e5e9c5","observation_id":"052532a1-9c86-440b-96ad-92209798469f","resolution":{"observed_at":"2026-08-07T14:02:59.277009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.036042Z","title":"Optimally sparse representation in general (nonorthogonal) dictionaries via l1 minimization.Proceedings of the National Academy of Sciences, 100(5):2197– 2202, 2003","venue":null,"work_id":"307d059a-321e-4078-a617-d14fa32c86fb","year":2003},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.383652Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:8b9807e4f3cd7ca215c727f929fb59dd8377eff9b0cdaadd64330b13b3d78fe2","observation_id":"eb97890a-4497-4757-91c6-f1b8787df341","resolution":{"observed_at":"2026-08-07T14:03:08.092039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-08-16T21:36:28.067615Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-07T14:02:59.477693Z","title":"Toy models of superposition.arXiv preprint arXiv:2209.10652, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.477693Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:db36661aa805bb201cfd8a309ca469bd2564f76226e2c99a64ae91854aa7fddb","observation_id":"ea1036f8-040f-4298-a3da-7ae2ee0a1cdf","resolution":{"observed_at":"2026-08-07T14:02:59.477693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.553114Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread, 1(1):12, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.553114Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:cf2b0f5a05b6b7f9fe4d2a9db95d745215926a9134b58da59b56a8f07e8e468e","observation_id":"6e73a26d-6fa2-4fbd-b629-66a9067e20c9","resolution":{"observed_at":"2026-08-07T14:02:59.553114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12892","last_updated":"2025-05-23T18:07:04Z","snapshot_observed_at":"2026-08-21T02:18:54.817354Z","submitted_at":"2025-02-18T14:29:11Z","title":"Archetypal SAE: Adaptive and Stable Dictionary Learning for Concept Extraction in Large Vision Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12892","snapshot_observed_at":"2026-08-07T14:02:59.630371Z","title":"Archetypal sae: Adaptive and stable dictionary learning for concept extraction in large vision models.arXiv preprint arXiv:2502.12892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.630371Z"},"links":{"cited_paper":"/paper/2502.12892","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:74b5cfa9d3408756c19399bc07eed032e1bc259ee907d03700da44dce8cb9030","observation_id":"db898c7e-37ed-42a2-aed4-64927b95be1a","resolution":{"observed_at":"2026-08-07T14:02:59.630371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.901569Z","title":"Scientific inference with interpretable machine learning: Analyzing models to learn about real-world phenomena.Minds and Machines, 34(3):32, 2024","venue":null,"work_id":"a435ab0b-9471-4f97-8126-326888922c10","year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.700647Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:0209dcdaaf7a01731d7c3590633ed9d7683ca3a6d5f28d082c6afaa3ea7711f9","observation_id":"17262248-3e93-4e91-99ee-b4c16cfb830b","resolution":{"observed_at":"2026-08-07T14:03:07.963257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T14:02:59.781474Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.781474Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:446b8a96997d9c252ffd96cced538d8061eb22bd0450cb758983996a5681ea3f","observation_id":"9a340735-39cf-4e46-b67a-61471657af26","resolution":{"observed_at":"2026-08-07T14:02:59.781474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-07T14:02:59.886828Z","title":"Scaling and evaluating sparse autoencoders.arXiv preprint arXiv:2406.04093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.886828Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:c609fc680abfeec78b5b1865c65ed9ab4e16cbfaa40ed766c548b90f2f5c180d","observation_id":"44650b81-0291-42d5-9ccd-10c19e3d95ab","resolution":{"observed_at":"2026-08-07T14:02:59.886828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.788508Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":"df2d27c2-8c88-483d-aaf4-9df96b6a5b8a","year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.040407Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:39fc3149aaa2ffb562c9ee22b4686511114284d6f73ca5f0a57a08d265341850","observation_id":"16e0a001-c085-469c-9db9-6eaa35db7c86","resolution":{"observed_at":"2026-08-07T14:03:07.848712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04709","last_updated":"2025-05-08T23:00:37Z","snapshot_observed_at":"2026-08-16T16:03:00.653173Z","submitted_at":"2023-01-11T20:42:41Z","title":"Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04709","snapshot_observed_at":"2026-08-07T14:03:00.147887Z","title":"Causal abstraction: A theoretical foundation for mechanistic interpretability.arXiv preprint arXiv:2301.04709, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.147887Z"},"links":{"cited_paper":"/paper/2301.04709","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:8029dd1e4546701951570a2527f1159eb8fd19290cb686b0d672cc066066dc12","observation_id":"ed653d77-400e-476f-b68f-b3871cd5a005","resolution":{"observed_at":"2026-08-07T14:03:00.147887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07122","last_updated":"2024-12-05T10:45:02Z","snapshot_observed_at":"2026-08-20T11:26:43.162421Z","submitted_at":"2024-11-11T16:51:39Z","title":"SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07122","snapshot_observed_at":"2026-08-07T14:03:00.224128Z","title":"Scar: Sparse conditioned autoencoders for concept detection and steering in llms.arXiv preprint arXiv:2411.07122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.224128Z"},"links":{"cited_paper":"/paper/2411.07122","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:cdea479a8fb5dd7da25a3bac38f6a2a5458f97c832f8085d5bbeec6461383c8c","observation_id":"711f7380-ba74-4da7-866d-6b0f7556bf10","resolution":{"observed_at":"2026-08-07T14:03:00.224128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.643841Z","title":"When can dictionary learning uniquely recover sparse data from subsamples?IEEE Transactions on Information Theory, 61(11):6290–6297, 2015","venue":null,"work_id":"4491feea-c341-4846-bbcb-90eb4ace01b9","year":2015},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.335412Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:2165f1bd66d063d8484846c9b3cbd998b399ee7099e3dc0d61d6a1ebfe349279","observation_id":"3dc34d7f-6197-46c2-b0e1-71ca5554b36e","resolution":{"observed_at":"2026-08-07T14:03:07.725224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.464472Z","title":"Projecting assumptions: The duality between sparse autoencoders and concept geometry.arXiv preprint arXiv:2503.01822, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.464472Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:7bc04386660c9f85b3bd633910b0f91d5a1404ace2c77545016f9c2f8ac3f5e6","observation_id":"1e0a86e9-fb72-408a-aca9-8bd88cdc2b1d","resolution":{"observed_at":"2026-08-07T14:03:00.464472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.545532Z","title":"Independent component analysis: algorithms and applications","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.545532Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:d3b9fee5f839879883f1fe7ff58333ae38ac377c0e9164043ba3dc30c725d619","observation_id":"30ea7564-3ac3-4918-8c04-284def90e3d4","resolution":{"observed_at":"2026-08-07T14:03:00.545532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.599280Z","title":"Identifiable steering via sparse autoencoding of multi-concept shifts.arXiv preprint arXiv:2502.12179, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.599280Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:0d01e073632f4aebd98866407b34f10def43cb463adcd9e25b495c8b1410d091","observation_id":"40145398-b7ba-4508-9d24-4cac2ad7d40a","resolution":{"observed_at":"2026-08-07T14:03:00.599280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.446919Z","title":"SAEBench: A Comprehensive Benchmark for Sparse Autoencoders.https://www.neuronpedia.org/sae-bench/info, 2024","venue":null,"work_id":"21923b13-9d07-4c42-867d-a6ddea3e9208","year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.650036Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:82d9ba20c0d7b3c99b585c5afca55768f65d2250599067c143527531d17ed3da","observation_id":"c34b9b99-f69f-4e55-acd7-16470e758eac","resolution":{"observed_at":"2026-08-07T14:03:07.558514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.249442Z","title":"Measuring progress in dictionary learning for language model interpretability with board game models.Advances in Neural Information Processing Systems, 37:83091–83118, 2024","venue":null,"work_id":"471e2dda-a2a4-4e45-bd9f-83d1d05a7639","year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.752206Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:ca1946d12bdca4a35ac1194fd724bd11e5c12b128aa7629f95df67086d134eec","observation_id":"d5a3890e-9477-4eb5-adb4-83caf2541240","resolution":{"observed_at":"2026-08-07T14:03:07.323869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-20T10:57:19.308652Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-07T14:03:00.843301Z","title":"Sparse autoencoders do not find canonical units of analysis.arXiv preprint arXiv:2502.04878, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.843301Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:7322265ce0a036bb54ce34bb01c91141be8823234c5cd35741a2d70425e41038","observation_id":"9472c785-10ea-4cc4-bee1-c5ab6b941e6d","resolution":{"observed_at":"2026-08-07T14:03:00.843301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.948695Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.948695Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:d06ad74afbb78f21af950083388fdde6f3134b66d701ef878cc968bc83d8c411","observation_id":"5afc856f-5def-4f83-a651-10d75b848acb","resolution":{"observed_at":"2026-08-07T14:03:00.948695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:01.063367Z","title":"The mythos of model interpretability: In machine learning, the concept of interpretability is both important and slippery.Queue, 16(3):31–57, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.063367Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:b65f1a78f4fe35501fdad89e977711f6e4acfa95f85bf596d04fda7f684a7c10","observation_id":"a6d3d15b-1428-4035-a894-0823aaa09cf9","resolution":{"observed_at":"2026-08-07T14:03:01.063367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17030","last_updated":"2023-12-06T14:28:46Z","snapshot_observed_at":"2026-08-16T14:39:31.719225Z","submitted_at":"2023-11-28T18:32:19Z","title":"Is This the Subspace You Are Looking for? An Interpretability Illusion for Subspace Activation Patching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17030","snapshot_observed_at":"2026-08-07T14:03:01.213348Z","title":"Is this the subspace you are looking for? an interpretability illusion for subspace activation patching.arXiv preprint arXiv:2311.17030, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.213348Z"},"links":{"cited_paper":"/paper/2311.17030","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:4c0496a322b690ec5e0e58ea39ce98efbb19dd9accbd6e6a1a64e5ab09bd19ce","observation_id":"9e74e2b7-c5fd-44be-881c-5fd1e2935ffc","resolution":{"observed_at":"2026-08-07T14:03:01.213348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01220","last_updated":"2024-11-06T08:42:09Z","snapshot_observed_at":"2026-08-20T06:46:17.051631Z","submitted_at":"2024-11-02T11:42:23Z","title":"Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01220","snapshot_observed_at":"2026-08-07T14:03:01.307047Z","title":"Enhancing neural network interpretability with feature-aligned sparse autoencoders.arXiv preprint arXiv:2411.01220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.307047Z"},"links":{"cited_paper":"/paper/2411.01220","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:f2b17a75330faf991f33163b118b297e2fe16de6f8b89072a38504f829711ca8","observation_id":"4ccd8b59-f9fb-46b4-bddd-424074957b94","resolution":{"observed_at":"2026-08-07T14:03:01.307047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.044415Z","title":"Dictionary learning","venue":null,"work_id":"8bd93df5-c6da-478c-82ca-42498f1de748","year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.452767Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:dd09f3c93d2f8961ba7e2d2a928a8aba7058970a9aaad7a21d7f4bab26272ec7","observation_id":"c2c6a64f-b920-4ca4-ab4c-4408c1615757","resolution":{"observed_at":"2026-08-07T14:03:07.152154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-08-14T07:35:01.333549Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-07T14:03:01.502160Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.502160Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:fa23e0f24f1c9245869dd425894875cb28893ad35058a978b20252a7d86c0cfc","observation_id":"2aa0ffdd-ad11-4ee0-a36f-eb6a806197e4","resolution":{"observed_at":"2026-08-07T14:03:01.502160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.909894Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":"d2f9721e-3b68-46d5-9b68-e4b01ff78b03","year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.565340Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:4f0a50e3e678053fdf289760fab54871947abfb0eae2f8a8859c216d060bbea1","observation_id":"70443d27-4dcd-47a8-af9a-664c3dc8acec","resolution":{"observed_at":"2026-08-07T14:03:06.970419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20914","last_updated":"2025-02-28T10:13:54Z","snapshot_observed_at":"2026-08-16T12:54:20.027050Z","submitted_at":"2025-02-28T10:13:54Z","title":"Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20914","snapshot_observed_at":"2026-08-07T14:03:01.725857Z","title":"Everything, everywhere, all at once: Is mechanistic interpretability identifiable?arXiv preprint arXiv:2502.20914, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.725857Z"},"links":{"cited_paper":"/paper/2502.20914","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:ce10a2cd1496609a864400357a6f4776206207c3e9fb38915e0a2db074e64376","observation_id":"611694cd-002a-4a4c-9c56-819eca673eed","resolution":{"observed_at":"2026-08-07T14:03:01.725857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08192","last_updated":"2025-04-11T01:24:03Z","snapshot_observed_at":"2026-08-20T02:52:18.580782Z","submitted_at":"2025-04-11T01:24:03Z","title":"SAEs $\\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08192","snapshot_observed_at":"2026-08-07T14:03:01.830004Z","title":"Saes can improve unlearn- ing: Dynamic sparse autoencoder guardrails for precision unlearning in llms.arXiv preprint arXiv:2504.08192, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.830004Z"},"links":{"cited_paper":"/paper/2504.08192","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:635cecf85f137b9e345b4f0c9b7305284577931b75d36654ecf01b31ac92a29c","observation_id":"5aa98ec1-5520-44bb-8dfb-b821c908129a","resolution":{"observed_at":"2026-08-07T14:03:01.830004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11296","last_updated":"2025-05-22T23:03:47Z","snapshot_observed_at":"2026-08-15T11:34:36.001446Z","submitted_at":"2024-11-18T05:47:02Z","title":"Steering Language Model Refusal with Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11296","snapshot_observed_at":"2026-08-07T14:03:01.923666Z","title":"Steering language model refusal with sparse autoencoders.arXiv preprint arXiv:2411.11296, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:01.923666Z"},"links":{"cited_paper":"/paper/2411.11296","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:f93f937a9aea7c93cfc138028924ca705401c32970796de049287670488c69b3","observation_id":"8971053d-2e39-4d5b-9596-5976a58bb55b","resolution":{"observed_at":"2026-08-07T14:03:01.923666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.711524Z","title":"Mechanistic interpretability, variables, and the importance of interpretable bases","venue":null,"work_id":"2c936fbb-ee73-4f75-a20d-b61c36c367f9","year":2022},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.049323Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:da7c3761b2ab7b7396e11d91ff2e2bef335cdf1cbcdf259dc547e2aa43721641","observation_id":"c0744883-b547-4b5c-b50f-e89ef3fdaee1","resolution":{"observed_at":"2026-08-07T14:03:06.824381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:02.169916Z","title":"Zoom in: An introduction to circuits.Distill, 5(3):e00024–001, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.169916Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:e767da0ad6d9b367d79f9e45374e6988081eeb10d169d0863f5cd61b53a224ba","observation_id":"f6606495-3294-41fe-b978-60cefaafdf67","resolution":{"observed_at":"2026-08-07T14:03:02.169916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.484954Z","title":"The building blocks of interpretability.Distill, 3(3):e10, 2018","venue":null,"work_id":"f2a88afb-7101-4ffb-9b7e-b9b121d4ef47","year":2018},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.289336Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:eef00628ec496250c751762a9310b37b736b3b83c6d9f57e9dfcbaec3f0d3e50","observation_id":"3db0a845-75cf-492c-8210-cf42f735372d","resolution":{"observed_at":"2026-08-07T14:03:06.551552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13117","last_updated":"2025-01-30T09:15:26Z","snapshot_observed_at":"2026-08-17T20:54:54.116259Z","submitted_at":"2024-11-20T08:21:53Z","title":"Compute Optimal Inference and Provable Amortisation Gap in Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13117","snapshot_observed_at":"2026-08-07T14:03:02.401440Z","title":"Compute optimal inference and provable amortisation gap in sparse autoencoders.arXiv preprint arXiv:2411.13117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.401440Z"},"links":{"cited_paper":"/paper/2411.13117","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:0d73b93f747ddf532b2530be10b5176dd5c64cb37790a07629b03bded764b4f9","observation_id":"80efe505-6c96-40c4-806b-a586fdc29537","resolution":{"observed_at":"2026-08-07T14:03:02.401440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:02.554813Z","title":"Sparse autoencoders learn monosemantic features in vision-language models.arXiv preprint arXiv:2504.02821, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.554813Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:143c9a484fa8e02fd5ae4bc3f7f7c2c557a052e193dae4d2ee887cec00b234fe","observation_id":"962b0a1f-79ea-4677-a29a-dddb71067f29","resolution":{"observed_at":"2026-08-07T14:03:02.554813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16615","last_updated":"2025-01-29T19:18:45Z","snapshot_observed_at":"2026-08-18T03:32:04.306379Z","submitted_at":"2025-01-28T01:24:16Z","title":"Sparse Autoencoders Trained on the Same Data Learn Different Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16615","snapshot_observed_at":"2026-08-07T14:03:02.656998Z","title":"Sparse autoencoders trained on the same data learn different features.arXiv preprint arXiv:2501.16615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.656998Z"},"links":{"cited_paper":"/paper/2501.16615","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:286e277759df51d5df5e972d4048e7cef00c9596fc67ea0e447a2a63ac3bf820","observation_id":"0174c757-c952-4a4b-86e9-ca37bda1d101","resolution":{"observed_at":"2026-08-07T14:03:02.656998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-16T13:08:17.757544Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-07T14:03:02.798784Z","title":"Automatically interpreting millions of features in large language models.arXiv preprint arXiv:2410.13928, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.798784Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:2c8c4b24778882335f5c19498d7c9132115df601d3678471463120cb6c8ce53e","observation_id":"69d5d226-67de-45f7-aa85-cd7999a7ea30","resolution":{"observed_at":"2026-08-07T14:03:02.798784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16014","last_updated":"2024-04-30T17:54:04Z","snapshot_observed_at":"2026-08-02T10:59:21.418230Z","submitted_at":"2024-04-24T17:47:22Z","title":"Improving Dictionary Learning with Gated Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16014","snapshot_observed_at":"2026-08-07T14:03:02.963645Z","title":"Improving dictionary learning with gated sparse autoencoders.arXiv preprint arXiv:2404.16014, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.963645Z"},"links":{"cited_paper":"/paper/2404.16014","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:a0ed3a699d9041b09ee2dee4f97fca2ff1d0b884b891263b776f593a22c71f1b","observation_id":"9157edce-d3e0-47ee-afc8-fd9ec6246fb9","resolution":{"observed_at":"2026-08-07T14:03:02.963645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14435","last_updated":"2024-08-01T17:42:04Z","snapshot_observed_at":"2026-08-08T18:10:15.134088Z","submitted_at":"2024-07-19T16:07:19Z","title":"Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14435","snapshot_observed_at":"2026-08-07T14:03:03.074303Z","title":"Jumping ahead: Improving reconstruction fidelity with jumprelu sparse autoencoders.arXiv preprint arXiv:2407.14435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.074303Z"},"links":{"cited_paper":"/paper/2407.14435","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:5609f4d6c35e414341c273f830bd867cdd26837d4112e75bb9f30667f406ea49","observation_id":"49a5bc79-cd46-4749-b6f5-eef6fb7db0f6","resolution":{"observed_at":"2026-08-07T14:03:03.074303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.301137Z","title":"Global identifiability of overcomplete dictionary learning via l1 and volume minimization","venue":null,"work_id":"c6126758-e91c-4d72-a34b-d07ad438131f","year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.174968Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:227c0f9d961a40cb41eb93230ba3a2e0f4dc383f9543379dc8ab26893f73dbae","observation_id":"c62a6bcc-f559-49e7-8447-343d0259e375","resolution":{"observed_at":"2026-08-07T14:03:06.409527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T14:03:03.259155Z","title":"Gemma: Open models based on gemini research and technology.arXiv preprint arXiv:2403.08295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.259155Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:42751239801d48784f895a2a36bdcd78828448df2536d39d5192ec4b19192870","observation_id":"c4230207-d7dc-463a-b104-9ce6c21900af","resolution":{"observed_at":"2026-08-07T14:03:03.259155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14709","last_updated":"2024-01-26T08:40:45Z","snapshot_observed_at":"2026-08-16T14:24:19.560388Z","submitted_at":"2024-01-26T08:40:45Z","title":"Identifiability of overcomplete independent component analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14709","snapshot_observed_at":"2026-08-07T14:03:03.323826Z","title":"Identifiability of overcomplete independent component analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.323826Z"},"links":{"cited_paper":"/paper/2401.14709","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:885b794098ef862878a2ff9b52f7748fd811100e929a42dbaf459e8685240596","observation_id":"34708252-3bf4-45cc-8e99-1421f135b8af","resolution":{"observed_at":"2026-08-07T14:03:03.323826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:05.780785Z","title":"Only the most frequent clusters show consistent reproducibility, indicating severe capacity limitations where the dictionary should prioritize only the dominant clusters","venue":null,"work_id":"fb64c57c-7bbf-4bec-8616-077bd88720f4","year":null},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.575402Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:e2954dfd5b3d4a1c9606341a03105f119e855ae15612af9af9257fd2ecc77730","observation_id":"6f2f630b-77d6-4bae-8949-39cd1ddfbc23","resolution":{"observed_at":"2026-08-07T14:03:05.923848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:05.581021Z","title":null,"venue":null,"work_id":"85de7c54-11c1-4613-9c41-69b4c9aba8c0","year":null},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.648467Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:f13e271bb1f684797dd507bfb454b734d00ba41d7549a64e72e29b917eece63e","observation_id":"9d6bfcb5-31d0-4e1f-84e2-1d5cb285e950","resolution":{"observed_at":"2026-08-07T14:03:05.688187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:05.395065Z","title":"The substantial increase in capacity 28 Figure 31:Two-phase model with dictionary size","venue":null,"work_id":"4043b573-a03a-45fc-8f60-7483eff4b8d0","year":null},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.719640Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:19d66b36ce30c6a4cc864f9540df4ae457220bfd08b55b98367b4327ba1f2c39","observation_id":"05aabd42-d69e-481d-9abc-b6c47954fd7c","resolution":{"observed_at":"2026-08-07T14:03:05.440082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.155339Z","title":"Figure 30:Two-phase model with dictionary size","venue":null,"work_id":"15660099-b8e3-48a2-ad91-d660c2e535ea","year":null},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.436592Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:5f325b3ecd5973bb81a9227195bea348db6fcf10ddd13acdc64322ad991006c5","observation_id":"475cb85b-8abe-441b-a0b3-9d13000a2038","resolution":{"observed_at":"2026-08-07T14:03:06.246169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.013683Z","title":"Figures 29 through 32 demonstrate how dictionary size affects feature reproducibility across the activation frequency spectrum","venue":null,"work_id":"028b9bc0-9641-487a-a416-52191e39c16f","year":null},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.496179Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:ebe29f0ab2da487e4a2f26c49d245e19ceb80c3e5b917724dcac6bbb52a5a30b","observation_id":"c5fb5432-f866-431a-b510-6ae0accdb7c2","resolution":{"observed_at":"2026-08-07T14:03:06.087258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:05.214172Z","title":"the same","venue":null,"work_id":"3cc48b22-5e48-4d6a-9c1e-2be657b23f9f","year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":1000,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:03.819990Z"},"links":{"citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:070e461b16242b9d452ee0238b4d4a8e7df484705ba0eedf6482e55e53bb35e8","observation_id":"8cfb17c6-1cd2-4de3-bf46-92a29dd0e9ad","resolution":{"observed_at":"2026-08-07T14:03:05.279790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2505.20254."}