{"as_of":"2026-08-10T21:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76eddfa2a4c34331c6efaf1d6d2c4b7bfc750444a6ce8b1ec81b13fb4d88c6ef","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":177,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":177,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":102,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:55:02.232925Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-10T14:55:02.232925Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Tom McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.14926","last_updated":"2025-02-07T19:22:32Z","snapshot_observed_at":"2026-08-10T14:44:40.420977Z","submitted_at":"2025-01-24T21:31:12Z","title":"Interpretability in Parameter Space: Minimizing Mechanistic Description Length with Attribution-based Parameter Decomposition","version":4},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T14:55:02.232925Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2501.14926"},"observation_digest":"sha256:876aa897810bd27f4c8d7bf0e2a2fbbb055a80d2b68a304fa2d17711496323a9","observation_id":"5d1fdc47-bc03-46b5-b430-4f90cb9c1ea1","resolution":{"observed_at":"2026-08-10T14:55:02.232925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-09T20:18:31.107491Z","title":"Slattery, P., Saeri, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.19406","last_updated":"2025-05-27T06:39:54Z","snapshot_observed_at":"2026-08-09T20:10:52.723666Z","submitted_at":"2025-01-31T18:59:16Z","title":"Low-Rank Adapting Models for Sparse Autoencoders","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T20:18:31.107491Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2501.19406"},"observation_digest":"sha256:287aac954554519878c89cedfdf171cb5fab8c99c0d05cf74fff8e6df6c8db02","observation_id":"75c4e53e-9a54-450a-a2fb-d33a00ac8c4b","resolution":{"observed_at":"2026-08-09T20:18:31.107491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-09T11:29:21.292467Z","title":"J., Casper, S., Tegmark, M., Saunders, W., Bau, D., Todd, E., Geiger, A., Geva, M., Hoogland, J., Murfet, D., and McGrath, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04358","last_updated":"2025-05-29T16:46:00Z","snapshot_observed_at":"2026-08-09T22:58:41.791750Z","submitted_at":"2025-02-04T20:47:43Z","title":"Position: Scaling LLM Agents Requires Asymptotic Analysis with LLM Primitives","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T11:29:21.292467Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2502.04358"},"observation_digest":"sha256:0e3a59ed3d4bb57b1c7d8715f331135964f5f80a25f185ccef775a8db0d5f822","observation_id":"190ff932-4df3-4855-b830-d3c10bd7b4d1","resolution":{"observed_at":"2026-08-09T11:29:21.292467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-08T19:15:55.034232Z","title":"J., Casper, S., Tegmark, M., Saunders, W., Bau, D., Todd, E., Geiger, A., Geva, M., Hoogland, J., Murfet, D., and McGrath, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05475","last_updated":"2025-02-08T07:24:04Z","snapshot_observed_at":"2026-08-09T02:15:12.668653Z","submitted_at":"2025-02-08T07:24:04Z","title":"You Are What You Eat -- AI Alignment Requires Understanding How Data Shapes Structure and Generalisation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-08T19:15:55.034232Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2502.05475"},"observation_digest":"sha256:45e11aa6827dade6fb336631f58a3c4c334ffe1cea63640ab7cbc4ad08971ed1","observation_id":"9da5522c-3365-4982-b9da-49247b4c1bf2","resolution":{"observed_at":"2026-08-08T19:15:55.034232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T18:32:14.806991Z","title":"J., Casper, S., Tegmark, M., Saunders, W., Bau, D., Todd, E., Geiger, A., Geva, M., Hoogland, J., Murfet, D., and McGrath, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10390","last_updated":"2025-07-08T18:20:16Z","snapshot_observed_at":"2026-08-08T23:23:47.910559Z","submitted_at":"2025-02-14T18:59:40Z","title":"(How) Can Transformers Predict Pseudo-Random Numbers?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:14.806991Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2502.10390"},"observation_digest":"sha256:a87fca3c4279b95a0c85e78521cbec334881b124a6e69d79d91cc7e7a3b56c19","observation_id":"c5ab5823-34e2-4239-b5eb-d2abb76398a7","resolution":{"observed_at":"2026-08-07T18:32:14.806991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T15:42:42.738291Z","title":"Sharkey, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14424","last_updated":"2025-05-20T14:32:03Z","snapshot_observed_at":"2026-08-09T11:14:26.878072Z","submitted_at":"2025-05-20T14:32:03Z","title":"Explaining Neural Networks with Reasons","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.738291Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.14424"},"observation_digest":"sha256:344d7915ce902e5e734f792f5b794bb4d66a7cbcbfa7e8f8f55ec8a7416bda60","observation_id":"17d25d3c-4e7f-4c85-a8bf-1e781629354c","resolution":{"observed_at":"2026-08-07T15:42:42.738291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T15:30:21.825428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15038","last_updated":"2025-07-29T21:40:42Z","snapshot_observed_at":"2026-08-08T23:07:55.774109Z","submitted_at":"2025-05-21T02:45:11Z","title":"Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:21.825428Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.15038"},"observation_digest":"sha256:fc8122ab3e664ad70bb42c7fe5e891aa5877239a39ee228f0176f40d1cb5d555","observation_id":"b71ef92c-986b-492d-bf4c-c50c5a7a7587","resolution":{"observed_at":"2026-08-07T15:30:21.825428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T14:44:43.200839Z","title":"Open problems in mechanistic interpretability.arXiv preprint arXiv:2501.16496,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17769","last_updated":"2025-06-12T11:54:13Z","snapshot_observed_at":"2026-08-10T17:21:02.901066Z","submitted_at":"2025-05-23T11:41:41Z","title":"Inference-Time Decomposition of Activations (ITDA): A Scalable Approach to Interpreting Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:43.200839Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.17769"},"observation_digest":"sha256:7c384ea702532545f6c260529457c8ecc70ed30cc2325a87c12961290f4aa0a0","observation_id":"3da134b9-22d9-4cf2-a558-34b803115ff3","resolution":{"observed_at":"2026-08-07T14:44:43.200839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T14:40:54.459356Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Tom McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18266","last_updated":"2025-05-23T18:02:46Z","snapshot_observed_at":"2026-08-09T00:29:07.939367Z","submitted_at":"2025-05-23T18:02:46Z","title":"Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:54.459356Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.18266"},"observation_digest":"sha256:f9b956c7ff2711f9968276d49d56a6af05783c8e0e361f7cdd097c623805fb70","observation_id":"30b1ff91-1129-4565-af17-7658331d90a5","resolution":{"observed_at":"2026-08-07T14:40:54.459356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T13:50:09.978542Z","title":"J., Casper, S., Tegmark, M., Saunders, W., Bau, D., Todd, E., Geiger, A., Geva, M., Hoogland, J., Murfet, D., and McGrath, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20896","last_updated":"2025-05-30T18:08:50Z","snapshot_observed_at":"2026-08-09T11:08:42.370443Z","submitted_at":"2025-05-27T08:39:20Z","title":"How Do Transformers Learn Variable Binding in Symbolic Programs?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:09.978542Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.20896"},"observation_digest":"sha256:641c64d4993f74d57f37510121f86a3c4813a92d722046daacbb9ad67421f736","observation_id":"4591e58e-693c-4a8d-b7f6-dc5599d4d472","resolution":{"observed_at":"2026-08-07T13:50:09.978542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T13:41:57.279860Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Tom McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21399","last_updated":"2025-05-27T16:24:02Z","snapshot_observed_at":"2026-08-09T17:19:27.700339Z","submitted_at":"2025-05-27T16:24:02Z","title":"Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:41:57.279860Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.21399"},"observation_digest":"sha256:3de629e3158a8b2d9c696c060aed9dfb7461fd0a8c9a64284fd1a60649038126","observation_id":"44b7442f-32c0-4d6c-94e5-e38f4619f4be","resolution":{"observed_at":"2026-08-07T13:41:57.279860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T13:11:09.340402Z","title":"Open problems in mechanistic interpretability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22506","last_updated":"2025-05-28T15:54:33Z","snapshot_observed_at":"2026-08-10T17:59:09.513021Z","submitted_at":"2025-05-28T15:54:33Z","title":"Sparsification and Reconstruction from the Perspective of Representation Geometry","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:11:09.340402Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.22506"},"observation_digest":"sha256:05ccf991dcab85b991f59ea6d79232cbb5930eb4e0036540cfed7e83c1d41e55","observation_id":"e2f85038-48b3-4789-9cad-ea89136df48a","resolution":{"observed_at":"2026-08-07T13:11:09.340402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T13:10:09.455799Z","title":"Open Problems in Mechanistic Interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.455799Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:ee77f24348e726711bb5d75a24f5c9eb2aa6fad52bb6bb15a090460a0bcd5e81","observation_id":"919f7776-77bc-4d98-9e36-159147c403cf","resolution":{"observed_at":"2026-08-07T13:10:09.455799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T13:26:00.227957Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Tom McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00041","last_updated":"2025-08-27T13:45:53Z","snapshot_observed_at":"2026-08-09T21:03:26.575507Z","submitted_at":"2025-05-28T02:50:17Z","title":"Decoding Dense Embeddings: Sparse Autoencoders for Interpreting and Discretizing Dense Retrieval","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:00.227957Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.00041"},"observation_digest":"sha256:ba7a2c90ce333fbd24de9f2e0cd3a0938a59da9b00a7045101cb74373373b739","observation_id":"a4fccfa1-52b1-4557-94cb-cab9a1e8d023","resolution":{"observed_at":"2026-08-07T13:26:00.227957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T13:09:58.250420Z","title":"J., Casper, S., Tegmark, M., Saunders, W., Bau, D., Todd, E., Geiger, A., Geva, M., Hoogland, J., Murfet, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00047","last_updated":"2025-05-28T16:52:44Z","snapshot_observed_at":"2026-08-07T13:01:23.937258Z","submitted_at":"2025-05-28T16:52:44Z","title":"Risks of AI-driven product development and strategies for their mitigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:58.250420Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.00047"},"observation_digest":"sha256:9997bc68ee832219a60dd40ba1c58f56f4da7bd52dad7ccaa8ed209856e74d23","observation_id":"9e8a247d-628d-4423-89f8-812a38e492f9","resolution":{"observed_at":"2026-08-07T13:09:58.250420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T10:46:20.241685Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Tom McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04461","last_updated":"2025-06-04T21:22:38Z","snapshot_observed_at":"2026-08-09T03:32:17.670536Z","submitted_at":"2025-06-04T21:22:38Z","title":"Behavioural vs. Representational Systematicity in End-to-End Models: An Opinionated Survey","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:20.241685Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.04461"},"observation_digest":"sha256:afe793826d68cdeaa199a22893f0266a5eb7cb8ddca875936b0c58b86e15b380","observation_id":"8c918ca0-37ad-4364-b348-98a8cb82979e","resolution":{"observed_at":"2026-08-07T10:46:20.241685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T10:46:54.785925Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Thomas McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06382","last_updated":"2026-07-31T15:48:01Z","snapshot_observed_at":"2026-08-08T12:38:09.647912Z","submitted_at":"2025-06-04T23:28:39Z","title":"On the Fundamental Impossibility of Hallucination Control in Large Language Models","version":8},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:46:54.785925Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.06382"},"observation_digest":"sha256:239854bdbda15af9f917cee7d44bf8f2d99dd9a8116063515c560af2e7dbacc2","observation_id":"29a830c7-73c5-455f-b948-c73a26e39bb3","resolution":{"observed_at":"2026-08-07T10:46:54.785925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T05:44:34.860460Z","title":"Open problems in mechanistic interpretability.arXiv preprint arXiv:2501.16496,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07406","last_updated":"2026-07-06T04:18:12Z","snapshot_observed_at":"2026-08-09T08:30:35.837462Z","submitted_at":"2025-06-09T03:59:28Z","title":"InverseScope: Scalable Activation Inversion for Interpreting Large Language Models","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:34.860460Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.07406"},"observation_digest":"sha256:f9c30203cce7b2606de3c8e4faedf1415c16b3f8160deb2d0ea7046bf03e690c","observation_id":"47020588-307b-4faa-a301-657d98bd9649","resolution":{"observed_at":"2026-08-07T05:44:34.860460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T01:06:07.977614Z","title":"Open problems in mechanistic interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-09T16:06:21.482138Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.977614Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:5e67fc1af94fe11722d3c1eaf6e220577965c306fb0a7046cbc805f3307dd547","observation_id":"54ecaa4c-e899-43b5-925b-20aa394b7bd5","resolution":{"observed_at":"2026-08-07T01:06:07.977614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T01:03:21.495743Z","title":"Sharkey, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12152","last_updated":"2025-06-13T18:13:58Z","snapshot_observed_at":"2026-08-10T03:56:47.932564Z","submitted_at":"2025-06-13T18:13:58Z","title":"Because we have LLMs, we Can and Should Pursue Agentic Interpretability","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T01:03:21.495743Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.12152"},"observation_digest":"sha256:ec75fe862585164e9deeef492b7d5c48fbe91bdfbe1924e7a18eaccf7e2e45a1","observation_id":"5584384c-eafb-41cf-9f8c-642c945093dd","resolution":{"observed_at":"2026-08-07T01:03:21.495743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-06T23:26:57.320407Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Tom McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17846","last_updated":"2025-06-21T22:45:19Z","snapshot_observed_at":"2026-08-07T19:34:31.461439Z","submitted_at":"2025-06-21T22:45:19Z","title":"Out of Control -- Why Alignment Needs Formal Control Theory (and an Alignment Control Stack)","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:57.320407Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.17846"},"observation_digest":"sha256:54c28c59bd083585b3b0c405b02f43c5ff9b552855637d2ad45e1e71220a80b4","observation_id":"40e474c2-869f-4a60-8bac-dba478f0581b","resolution":{"observed_at":"2026-08-06T23:26:57.320407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2506.18852","last_updated":"2026-05-19T12:40:52Z","snapshot_observed_at":"2026-08-09T01:12:01.447404Z","submitted_at":"2025-06-23T17:13:30Z","title":"Mechanistic Interpretability Needs Philosophy","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T23:49:19.683025Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.18852"},"observation_digest":"sha256:b7214c49ca1376d9c90bb13a4f9e73a892a201059b37606d9ac4c85d54c07d01","observation_id":"aedf96a0-5269-409e-a0c7-9c25cfb7b7f0","resolution":{"observed_at":"2026-05-21T23:50:47.297873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-06T22:48:38.733150Z","title":"Michaud, Stephen Casper, Max Tegmark, William Saunders, David Bau, Eric Todd, Atticus Geiger, Mor Geva, Jesse Hoogland, Daniel Murfet, and Tom McGrath","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20790","last_updated":"2025-09-04T11:41:34Z","snapshot_observed_at":"2026-08-09T03:26:19.673933Z","submitted_at":"2025-06-25T19:26:31Z","title":"Stochastic Parameter Decomposition","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:48:38.733150Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.20790"},"observation_digest":"sha256:4949da650f078431991b95ffad37dbe2eda907aaa7fea9a52e3002d11d625720","observation_id":"c51c0ec3-ae89-4f7d-9ea1-328ace5d5dc0","resolution":{"observed_at":"2026-08-06T22:48:38.733150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-06T21:34:33.494081Z","title":"Sharkey, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23845","last_updated":"2026-07-04T18:58:34Z","snapshot_observed_at":"2026-08-08T16:55:54.886065Z","submitted_at":"2025-06-30T13:35:56Z","title":"Position: Use Sparse Autoencoders to Discover Unknowns","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:33.494081Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.23845"},"observation_digest":"sha256:59598817108e42b8be24a0ca2646606f7519548af2e403d1f59e13be3d94ed94","observation_id":"1dd42544-8ad2-47ff-8e75-92947e5ea738","resolution":{"observed_at":"2026-08-06T21:34:33.494081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-06T21:34:15.531365Z","title":"19 Zhengxiang Shi, Adam Yang, Bin Wu, Laurence Aitchison, Emine Yilmaz, and Aldo Lipani","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23908","last_updated":"2025-06-30T14:37:50Z","snapshot_observed_at":"2026-08-07T21:55:54.380963Z","submitted_at":"2025-06-30T14:37:50Z","title":"Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:15.531365Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.23908"},"observation_digest":"sha256:c03e541f1b47aff871afb2ec765d3e430253267c680effc7d92f55b86908b0d4","observation_id":"cb795f77-cfc4-436b-8d93-9af6e3b3d8d9","resolution":{"observed_at":"2026-08-06T21:34:15.531365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-06T16:51:54.104626Z","title":"arXiv preprint arXiv:2501.16496 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12464","last_updated":"2025-07-16T17:59:32Z","snapshot_observed_at":"2026-08-10T12:18:45.364300Z","submitted_at":"2025-07-16T17:59:32Z","title":"CytoSAE: Interpretable Cell Embeddings for Hematology","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:54.104626Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2507.12464"},"observation_digest":"sha256:2b67f09dfb849115d202ccd44b435ea4ead6358bbe704e28e0551645cd0674d1","observation_id":"414bdef2-d59a-4fa1-b464-57ccf9deb578","resolution":{"observed_at":"2026-08-06T16:51:54.104626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2508.05463","last_updated":"2026-05-11T09:35:56Z","snapshot_observed_at":"2026-08-08T15:52:37.849923Z","submitted_at":"2025-08-07T15:02:39Z","title":"Task complexity shapes internal representations and robustness in neural networks","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T23:50:09.749179Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2508.05463"},"observation_digest":"sha256:637f2d20ad3ddf613300adb3b509ed8677e08cdd671fabb64547ef87fac4ef35","observation_id":"65d59515-c219-40fd-b934-1b5d17cd9996","resolution":{"observed_at":"2026-05-18T23:51:54.745952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T18:42:02.956496Z","title":"Open problems in mechanistic interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15847","last_updated":"2025-08-19T22:57:17Z","snapshot_observed_at":"2026-08-09T23:43:09.455213Z","submitted_at":"2025-08-19T22:57:17Z","title":"Mechanistic Exploration of Backdoored Large Language Model Attention Patterns","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T18:42:02.956496Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2508.15847"},"observation_digest":"sha256:3f9fbef0a0bb9e54a01a228a525c529a20c2cebb3894123c6165512f76fe6388","observation_id":"1127dc0b-0c0f-49ac-b1f8-90151723e9e8","resolution":{"observed_at":"2026-08-05T18:42:02.956496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T17:26:48.632505Z","title":"Open problems in mechanistic interpretability.arXiv preprint arXiv:2501.16496, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16318","last_updated":"2025-09-01T08:35:27Z","snapshot_observed_at":"2026-08-10T01:27:53.917270Z","submitted_at":"2025-08-22T11:57:55Z","title":"SATORI: Static Test Oracle Generation for REST APIs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:26:48.632505Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2508.16318"},"observation_digest":"sha256:b69e857b9d32e251165347788353a52e68b07ae28c13197bc341f0b22fa1bf4f","observation_id":"486e437e-19bd-4800-bbea-32c5ed1fca99","resolution":{"observed_at":"2026-08-05T17:26:48.632505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T18:47:45.332785Z","title":"URL https://arxiv.org/abs/2501.16496","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-05T18:44:01.835548Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.332785Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:bc1dfe4fada6fec2ab4bf0e6806f79560d1cd9840b97185f1a118726b1b5b1e3","observation_id":"a00a0626-d2ba-46e1-a2c7-2d14dcd321c4","resolution":{"observed_at":"2026-08-05T18:47:45.332785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T11:26:17.847288Z","title":"Open problems in mechanistic interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02805","last_updated":"2025-09-02T20:15:49Z","snapshot_observed_at":"2026-08-10T13:19:08.370154Z","submitted_at":"2025-09-02T20:15:49Z","title":"Challenges in Understanding Modality Conflict in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T11:26:17.847288Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2509.02805"},"observation_digest":"sha256:dfe18352b55824b4a695e3b77b45794cbca2c0d1bf727e7b3d4d7a3e056a01f9","observation_id":"7aa04eb6-b3bc-42af-97a7-eff4940835a2","resolution":{"observed_at":"2026-08-05T11:26:17.847288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-04T23:10:46.324925Z","title":"Openproblemsinmechanisticinterpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06786","last_updated":"2025-09-08T15:13:23Z","snapshot_observed_at":"2026-08-10T09:28:02.808191Z","submitted_at":"2025-09-08T15:13:23Z","title":"\\texttt{R$^\\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:46.324925Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2509.06786"},"observation_digest":"sha256:2b5756d09c17e1b390e9d0c6ef201461f1a4571f7e5fe28c17ec3379ef41ea1e","observation_id":"9feca2dc-b196-4eed-918f-dcdc12b219cf","resolution":{"observed_at":"2026-08-04T23:10:46.324925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-04T18:01:02.649733Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10289","last_updated":"2025-09-12T14:29:14Z","snapshot_observed_at":"2026-08-09T00:47:32.175082Z","submitted_at":"2025-09-12T14:29:14Z","title":"We Need a New Ethics for a World of AI Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:01:02.649733Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2509.10289"},"observation_digest":"sha256:de49cced5c6eb9e60cb6b98299a949b35129497998b384584a01b07e1b64f015","observation_id":"46dd83e5-81b7-4785-8c23-1c4a5d7ea856","resolution":{"observed_at":"2026-08-04T18:01:02.649733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2509.13316","last_updated":"2026-05-13T17:55:29Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T17:59:04Z","title":"Do Activation Verbalization Methods Convey Privileged Information?","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T15:41:46.771905Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2509.13316"},"observation_digest":"sha256:ac9ca08d891764dc0bc632520eb8ea20c5c93e5de7d548093cc291ef3428276d","observation_id":"0dd62860-9d42-4914-b4ac-67e3bdb9673a","resolution":{"observed_at":"2026-05-18T15:42:42.156296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2509.25843","last_updated":"2026-04-14T14:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-30T06:33:52Z","title":"ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2509.25843"},"observation_digest":"sha256:54d3667c15d7f4d2164a5f99bdf3738aa244902f305180a9e892b8b7a88ca7ac","observation_id":"3973880d-2d93-49e7-8241-a9134b7803b1","resolution":{"observed_at":"2026-05-18T13:06:23.426950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2510.00468","last_updated":"2026-05-06T17:51:40Z","snapshot_observed_at":"2026-07-06T22:31:20.110402Z","submitted_at":"2025-10-01T03:39:48Z","title":"Feature Identification via the Empirical NTK","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T11:01:14.230977Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2510.00468"},"observation_digest":"sha256:196063d153a73b74b0fb18c4ee69582dc1d1fba901eb79b9fe4843d810f7e4aa","observation_id":"fe01834c-621b-426b-ad2f-964f424cf967","resolution":{"observed_at":"2026-05-18T11:01:16.935370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2510.01025","last_updated":"2026-04-07T13:36:28Z","snapshot_observed_at":"2026-08-02T10:13:42.372246Z","submitted_at":"2025-10-01T15:30:47Z","title":"Hypothesis-Driven Feature Manifold Analysis in LLMs via Supervised Multi-Dimensional Scaling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T10:39:32.910190Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2510.01025"},"observation_digest":"sha256:507be4d8af3dfe09f9529c6c096f423eb56e301ddc130172d36a3cfb21ec072d","observation_id":"afa98fb5-78dd-4682-82bf-0106ea6ebe34","resolution":{"observed_at":"2026-05-18T10:41:16.005714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2510.03271","last_updated":"2026-05-21T09:16:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-27T07:42:54Z","title":"Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T13:22:37.107679Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2510.03271"},"observation_digest":"sha256:5e3aec5bb61a3792472cfe9622356016ecd0c7e57940daf692d2c93e4b3e984d","observation_id":"8be092f4-4e0d-48bb-813f-c95844dc4543","resolution":{"observed_at":"2026-05-22T13:24:53.325174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2510.03271","last_updated":"2026-05-21T09:16:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-27T07:42:54Z","title":"Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T13:22:37.107679Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2510.03271"},"observation_digest":"sha256:c522f74a1dc11e9505f246dc02dbdc87acd9c348c7590d19f30e1589a33483c6","observation_id":"6894c222-62fd-4f54-8a11-30e74d357a9e","resolution":{"observed_at":"2026-05-22T13:24:53.065282Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-04T09:08:54.672241Z","title":"Open Problems in Mechanistic Interpretability .arXiv preprint arXiv:2501.16496, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17256","last_updated":"2026-06-03T19:38:37Z","snapshot_observed_at":"2026-08-08T10:07:33.427560Z","submitted_at":"2025-10-20T07:43:53Z","title":"Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:54.672241Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2510.17256"},"observation_digest":"sha256:a67edf0ee8bc5695ea1e0a0ff0f1d649686227c3eceaf88ffb30f9a0da996eb2","observation_id":"49e5798c-ace3-4197-a9c7-2e6038316587","resolution":{"observed_at":"2026-08-04T09:08:54.672241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-03T23:18:42.819258Z","title":"Evans, London","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.06613","last_updated":"2026-06-05T18:10:06Z","snapshot_observed_at":"2026-08-08T15:55:40.440482Z","submitted_at":"2025-11-10T01:46:55Z","title":"Some economics of artificial superintelligence","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T23:18:42.819258Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2511.06613"},"observation_digest":"sha256:bc148bdadcd60f000986409f376b5a624c01b2ed906729c9d55d6e542baf34a7","observation_id":"69af4bca-e6f9-4c18-a824-b6177d61e9a6","resolution":{"observed_at":"2026-08-03T23:18:42.819258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2512.05742","last_updated":"2026-05-20T12:16:41Z","snapshot_observed_at":"2026-08-02T17:55:29.577677Z","submitted_at":"2025-12-05T14:21:02Z","title":"Internal Deployment in the AI Act","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-21T17:51:47.841707Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2512.05742"},"observation_digest":"sha256:2277cf8d9b3f7fd7b78a7a9737e1270d5cb8a62f9726204acdebec4af0699296","observation_id":"aca47b11-2890-4de7-8d0e-993852cd1ac5","resolution":{"observed_at":"2026-05-21T17:54:18.538252Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T23:38:14.568953Z","title":"attend iff(x 1, y1)is present","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.13524","last_updated":"2026-05-27T17:09:07Z","snapshot_observed_at":"2026-08-10T01:03:44.629265Z","submitted_at":"2026-02-13T23:30:02Z","title":"Singular Vectors of Attention Heads Align with Features","version":2},"reference_index":1972,"source":"pdf_text","source_observed_at":"2026-08-02T23:38:14.568953Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2602.13524"},"observation_digest":"sha256:145a2bb4b43fbad9d6e4cd1062a5991f88641a7dea01e29d5e11774982d173a3","observation_id":"d610a1c0-cf66-4de5-b807-533ef22ec407","resolution":{"observed_at":"2026-08-02T23:38:14.568953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T20:46:29.019024Z","title":"Open problems in mechanistic interpretability.arXiv preprint arXiv:2501.16496, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22600","last_updated":"2026-07-06T18:07:55Z","snapshot_observed_at":"2026-08-10T18:38:17.977304Z","submitted_at":"2026-02-26T04:09:11Z","title":"Transformers converge to invariant algorithmic cores","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:46:29.019024Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2602.22600"},"observation_digest":"sha256:f852f7e9b42b4ab2dcaadef3f23f28d72e78085c15fffe33b2b32903cc735024","observation_id":"90b20a3c-93e6-4d89-888e-f2b6e3d23fb4","resolution":{"observed_at":"2026-08-02T20:46:29.019024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T21:21:26.170990Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13249","last_updated":"2026-05-28T14:47:48Z","snapshot_observed_at":"2026-08-09T02:53:25.541953Z","submitted_at":"2026-02-24T07:26:50Z","title":"Steering at the Source: Style Modulation Heads for Robust Persona Control","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:21:26.170990Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2603.13249"},"observation_digest":"sha256:6b11a7e75f822499f8470e197fe902de54b6ae262b5c50199afb0c25f975aa9d","observation_id":"327b16b1-7168-42ea-a292-e4ebbb6c1b41","resolution":{"observed_at":"2026-08-02T21:21:26.170990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.05030","last_updated":"2026-04-28T16:30:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T18:00:03Z","title":"Phase-Associative Memory: Sequence Modeling in Complex Hilbert Space","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T19:39:50.311059Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.05030"},"observation_digest":"sha256:fc94665639a40877ea728d253c924cfdf77fb9af6726810904549c4098b74bf8","observation_id":"50faadc7-4624-4cf7-9ec9-c6c7d9942b90","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.11962","last_updated":"2026-05-07T18:19:16Z","snapshot_observed_at":"2026-07-06T23:00:12.978356Z","submitted_at":"2026-04-13T18:54:38Z","title":"The Linear Centroids Hypothesis: Features as Directions Learned by Local Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:25:57.273965Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.11962"},"observation_digest":"sha256:a38a2f2493b72b7fff6a6ebf7957ed4b813c46cb4f4ddcec6ba5b111c92f6773","observation_id":"d2337bd9-2222-4d26-8495-b65ad970e9af","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.11962","last_updated":"2026-05-07T18:19:16Z","snapshot_observed_at":"2026-07-06T23:00:12.978356Z","submitted_at":"2026-04-13T18:54:38Z","title":"The Linear Centroids Hypothesis: Features as Directions Learned by Local Experts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:07.373414Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.11962"},"observation_digest":"sha256:02151bdd5a1cc300eee967bcbcea7a4609783206ebb3d2df0ed7c64c2b29265d","observation_id":"99127db3-ebd8-4dd4-8844-f2479e024303","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.16426","last_updated":"2026-04-04T17:50:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-04T17:50:07Z","title":"Functional Similarity Metric for Neural Networks: Overcoming Parametric Ambiguity via Activation Region Analysis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T17:51:29.832500Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.16426"},"observation_digest":"sha256:752e332819b2225154d65bb2cadf80ce6d6c8fb656dbf1742e5b57f9befe87b3","observation_id":"9c48241c-24be-43f4-b282-22e72fd9de63","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.17568","last_updated":"2026-04-19T18:18:34Z","snapshot_observed_at":"2026-08-02T07:07:52.683666Z","submitted_at":"2026-04-19T18:18:34Z","title":"Diverse Dictionary Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T06:39:26.132003Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.17568"},"observation_digest":"sha256:4821a144653cee1f8b3c2e5a9a9c4b72cff995d1740b2a5c0f6e6dcfc7c14ae4","observation_id":"fdad4d2b-6a09-4abb-a7e6-0ed2e1d0bc0c","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.18487","last_updated":"2026-04-20T16:37:27Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:37:27Z","title":"Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T04:17:43.880661Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.18487"},"observation_digest":"sha256:e15c5b9fe4b47129dfcf666b27fce25bfc3e202561c342113e6cf6d156756ad2","observation_id":"602ab21c-a12c-45c1-bf27-2de8195f388b","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.19260","last_updated":"2026-04-21T09:21:14Z","snapshot_observed_at":"2026-07-31T22:25:13.931512Z","submitted_at":"2026-04-21T09:21:14Z","title":"Understanding the Mechanism of Altruism in Large Language Models","version":1},"reference_index":230,"source":"arxiv_source","source_observed_at":"2026-05-10T01:36:50.329664Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.19260"},"observation_digest":"sha256:c7bfb52ee54f4efa97f2024d7816304d12e213e83a7b8cee22971dcd1628cb4a","observation_id":"a98b13c9-7ceb-4c25-8ef4-53b34d117048","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2604.21691","last_updated":"2026-04-23T13:58:12Z","snapshot_observed_at":"2026-08-02T12:48:50.592713Z","submitted_at":"2026-04-23T13:58:12Z","title":"There Will Be a Scientific Theory of Deep Learning","version":1},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-05-09T20:11:17.616190Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2604.21691"},"observation_digest":"sha256:52152c90ef63bfac2605bb61641a09ed34519e1c4b1bebe7a3d16ac9fc63bc0a","observation_id":"f898cbd0-13be-4004-9f07-cb2d2b90f160","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.01048","last_updated":"2026-05-01T19:23:33Z","snapshot_observed_at":"2026-07-06T23:14:20.123289Z","submitted_at":"2026-05-01T19:23:33Z","title":"Compared to What? Baselines and Metrics for Counterfactual Prompting","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-09T19:02:46.991897Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.01048"},"observation_digest":"sha256:ca8be91b1a3f27c987544110c29e43afb5021fb94fa0bb690687cab0d9f19149","observation_id":"8d03db4a-339b-41fd-9ec3-1604d377aff2","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.01148","last_updated":"2026-05-01T22:49:29Z","snapshot_observed_at":"2026-07-06T23:14:24.758147Z","submitted_at":"2026-05-01T22:49:29Z","title":"Arithmetic in the Wild: Llama uses Base-10 Addition to Reason About Cyclic Concepts","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-09T18:48:04.046370Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.01148"},"observation_digest":"sha256:f3f5ac9dccc5e2db87df754a80a42eda70007859ce1f21ffb6503ec63c20ebfd","observation_id":"b176c6a8-7299-4588-afea-58e6699bcce2","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.01192","last_updated":"2026-05-02T02:11:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-02T02:11:31Z","title":"Linear-Readout Floors and Threshold Recovery in Computation in Superposition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T14:20:04.839150Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.01192"},"observation_digest":"sha256:b38f75d03aaca372e589b480c655352b54d66ed1dfafc1f0e9a2bc639a1debe2","observation_id":"fc33ff26-dc31-4f7c-9083-1c53c39ec565","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.03354","last_updated":"2026-05-07T05:56:54Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:17:22Z","title":"What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T18:33:43.998202Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.03354"},"observation_digest":"sha256:52e9bf766c3a91ee20408fd3c0cccc8e03613a942892919a63ec5b88be89d607","observation_id":"3f373b76-6617-469a-84b1-b2b6b46973fd","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-08T15:35:08.202464Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:0a0bb7f9966f84baa44706a3dc1c7f9f3d4504e5c83125549673dbb5ff70ce05","observation_id":"1ec700c8-2b4d-449a-a155-81d2976a55f3","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:55.375541Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:ceee5499d6511d5ad59c794a969eda9a124a958ca2c3a92d9842ea2f7ed9c514","observation_id":"6d6162f0-68f5-41c0-b5b5-238ac11a8d83","resolution":{"observed_at":"2026-06-30T23:35:07.981613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.05115","last_updated":"2026-05-06T16:46:03Z","snapshot_observed_at":"2026-08-07T10:12:24.411121Z","submitted_at":"2026-05-06T16:46:03Z","title":"Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-08T17:47:09.591001Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.05115"},"observation_digest":"sha256:6cb1a2da56886d8cd3226bf7ced01b615ad1664a246a2dc259da2d7ec2fab105","observation_id":"4d72dd99-4ea6-407e-a315-744b1ea3a925","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.08891","last_updated":"2026-05-09T11:16:34Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T11:16:34Z","title":"Bilinear autoencoders find interpretable manifolds","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-12T01:25:35.920367Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.08891"},"observation_digest":"sha256:a2d5788631215f429372895d74c468c8acb4b93db41e9196c23633f63140349e","observation_id":"1554ce28-e0c3-4fd1-a1f7-e3ac49780471","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.08934","last_updated":"2026-06-16T20:17:16Z","snapshot_observed_at":"2026-08-10T02:05:06.793545Z","submitted_at":"2026-05-09T13:08:07Z","title":"From Mechanistic to Compositional Interpretability","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-12T02:42:26.173782Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.08934"},"observation_digest":"sha256:356ae35737bcd747748abd6b9f27afa6ec63839a2fb533cb07cbdd9ade2e19ec","observation_id":"0d33df20-8fa4-4df4-a30d-a013c45da974","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.09391","last_updated":"2026-05-15T12:37:57Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:38:34Z","title":"Do Linear Probes Generalize Better in Persona Coordinates?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T04:47:47.214726Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.09391"},"observation_digest":"sha256:3229f3cad2366f93863fd2741fec73762c37f57a9730d564678e938ce1b6cd5d","observation_id":"ebcc1c64-06cd-4f63-8baa-fd9145dc60d2","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.09391","last_updated":"2026-05-15T12:37:57Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:38:34Z","title":"Do Linear Probes Generalize Better in Persona Coordinates?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-19T17:06:22.481341Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.09391"},"observation_digest":"sha256:b2652b1754c88ca61f91e33e5a88eacdc977b3206eb75cb22021fb3734e80db0","observation_id":"0d44401a-0fe5-4f4f-8d5b-8f57e2d138bb","resolution":{"observed_at":"2026-05-19T17:07:40.471481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.09438","last_updated":"2026-05-10T09:25:45Z","snapshot_observed_at":"2026-08-02T17:03:45.560985Z","submitted_at":"2026-05-10T09:25:45Z","title":"fmxcoders: Factorized Masked Crosscoders for Cross-Layer Feature Discovery","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:54:41.225199Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.09438"},"observation_digest":"sha256:fd1c17266ad20a17177b09edfc0d22f7e185b3cf77f020bab6553cb57577a027","observation_id":"35e42c23-a4a1-4037-98de-8da6505aa50a","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.11887","last_updated":"2026-05-12T10:01:06Z","snapshot_observed_at":"2026-07-29T16:09:50.456033Z","submitted_at":"2026-05-12T10:01:06Z","title":"Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-13T05:38:31.094834Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.11887"},"observation_digest":"sha256:22041128e429b39041746c6c0fd85e569d7bc83058b5a206888e4f5eb5a9c117","observation_id":"20a61b1d-76e3-4180-bebd-16a5a2a48517","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.12128","last_updated":"2026-05-12T13:50:26Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T13:50:26Z","title":"Metaphor Is Not All Attention Needs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T05:59:39.485618Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.12128"},"observation_digest":"sha256:ee37a629e5a9c03f81db84259f5a57a653a4bf60169b8a9c2b6a0e218ddef59e","observation_id":"82a9a522-b342-4779-960f-0947f5b1bd04","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:46caffdd248ec231a109a1be43fe24d5cbf6adf8b813188a406e5aa57d963874","observation_id":"a016c9a3-61bc-4973-8d54-32712ddabde8","resolution":{"observed_at":"2026-05-14T18:30:06.348607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-14T20:53:40.666929Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:1c3cfb496ac065253bbb0f3586671ce0cbe440fef1db64c9815707f90e495580","observation_id":"97721bca-9435-45d4-87fd-e19266247cc5","resolution":{"observed_at":"2026-05-14T20:59:28.715619Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-15T04:59:11.877068Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:f346c8970ba3b2834e662498399b71612385b710e86bd68d70461726abcd899a","observation_id":"3dcb8d84-c08f-4b65-a915-38604c7543ac","resolution":{"observed_at":"2026-05-15T04:59:45.052674Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-20T21:49:47.934339Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:f6282cfa6e2d6ba0d16077a6b2262e9f9a667617ab3b0d3c01917a4c69212904","observation_id":"57a03569-8ab6-4e6c-a037-ed4b5c2a5616","resolution":{"observed_at":"2026-05-20T21:53:47.195232Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.13329","last_updated":"2026-05-13T10:44:23Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T10:44:23Z","title":"Tracing Persona Vectors Through LLM Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:28:17.086117Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.13329"},"observation_digest":"sha256:25e60422cf4836b9bb1728f5ebae051fc90074b365dd00355aa00379273e989d","observation_id":"83788547-003f-413a-a697-dc1896affb6b","resolution":{"observed_at":"2026-05-14T20:29:27.899540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.16041","last_updated":"2026-05-15T15:14:13Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:14:13Z","title":"Explainable AI Isn't Enough! Rethinking Algorithmic Contestability","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-19T19:08:05.556651Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.16041"},"observation_digest":"sha256:dacb9ffdd4872f81e17a50447c67cd34ad05b031c6113e329201d4572a8ff301","observation_id":"896c9ec7-051e-4b98-af56-eef1f043f7c3","resolution":{"observed_at":"2026-05-19T19:12:43.807569Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.20607","last_updated":"2026-05-20T01:49:59Z","snapshot_observed_at":"2026-07-06T23:31:08.671011Z","submitted_at":"2026-05-20T01:49:59Z","title":"Mechanistic Interpretability for Learning Assurance of a Vision-Based Landing System","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T06:56:23.842767Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.20607"},"observation_digest":"sha256:9156502acff4753ba863ab75b17a665842fa95fe37630655d0e8d991d885b890","observation_id":"28fdf147-299c-479d-9c97-ea8bffb1e399","resolution":{"observed_at":"2026-05-21T06:59:45.603518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.21849","last_updated":"2026-05-21T00:46:01Z","snapshot_observed_at":"2026-08-03T04:39:11.733198Z","submitted_at":"2026-05-21T00:46:01Z","title":"Geometry-Adaptive Explainer for Faithful Dictionary-Based Interpretability under Distribution Shift","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T08:14:58.183289Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.21849"},"observation_digest":"sha256:05e47e13845fba2bfa13700f860cc32f886fc4b1ac874a63dbf03a6946e02f22","observation_id":"5e5cc594-e20c-4b20-b906-73920776928a","resolution":{"observed_at":"2026-05-22T08:16:16.110708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.22531","last_updated":"2026-05-21T14:22:25Z","snapshot_observed_at":"2026-08-09T13:03:27.098953Z","submitted_at":"2026-05-21T14:22:25Z","title":"Disentanglement Beyond Generative Models with Riemannian ICA","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T07:49:28.234614Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.22531"},"observation_digest":"sha256:666bc2683f6fe8cb8df79c4da8eb8363b2ca0d0ea167092fc5126436686588d2","observation_id":"5f1e45e0-bde3-4f0b-816f-c2a5a2ebd8ee","resolution":{"observed_at":"2026-05-22T07:51:15.997118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.22532","last_updated":"2026-05-23T09:13:45Z","snapshot_observed_at":"2026-08-02T17:55:32.280248Z","submitted_at":"2026-05-21T14:22:27Z","title":"Relational Linear Properties in Language Models: An Empirical Investigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:09.743615Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.22532"},"observation_digest":"sha256:439a527e7513654643e959c39079a3c8e8b01f2801dbec639e6d81e1bdfc6628","observation_id":"5f0c9566-37d2-4ab2-b891-89a203de4cdf","resolution":{"observed_at":"2026-05-22T07:46:15.014015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.22532","last_updated":"2026-05-23T09:13:45Z","snapshot_observed_at":"2026-08-02T17:55:32.280248Z","submitted_at":"2026-05-21T14:22:27Z","title":"Relational Linear Properties in Language Models: An Empirical Investigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T17:13:03.620676Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.22532"},"observation_digest":"sha256:96af7b08f19dfb52f3a4d961346df2a0262166c0e78a178a20ffbdbcb827de62","observation_id":"43b05f4a-3053-40c4-92e1-e2c0fc207530","resolution":{"observed_at":"2026-06-30T17:14:56.781346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2605.28649","last_updated":"2026-05-27T15:52:39Z","snapshot_observed_at":"2026-07-06T23:38:14.056361Z","submitted_at":"2026-05-27T15:52:39Z","title":"Interpretability-Guided Layer Selection over Subspace Projection: SAEs as Stethoscopes, Not Scalpels, for Raw Task Vector Model Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T14:00:31.962058Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2605.28649"},"observation_digest":"sha256:6a09b6e63ee02ea4f885a643cf34ab294248a51b526673630ae9074e14cf7d42","observation_id":"f7a3be11-03e7-4581-8494-14c97ca3fb21","resolution":{"observed_at":"2026-06-29T14:03:29.439485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2606.06333","last_updated":"2026-06-04T16:08:25Z","snapshot_observed_at":"2026-08-02T07:30:20.394633Z","submitted_at":"2026-06-04T16:08:25Z","title":"Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T02:07:18.198225Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2606.06333"},"observation_digest":"sha256:24f7edd6f0850dd9bb8ed8b92395c0e6af83bb017a6719589bd3fb5ab2525589","observation_id":"9155af1c-7b97-4a31-a89d-d98f687d60f9","resolution":{"observed_at":"2026-06-28T02:11:29.091386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2606.08292","last_updated":"2026-08-04T22:09:28Z","snapshot_observed_at":"2026-08-08T23:10:22.150072Z","submitted_at":"2026-06-06T18:29:04Z","title":"Necessary, Decodable and Reversible, Yet Not Transferable: A Stress Test for Attention-Head Role Claims","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:33:19.875024Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2606.08292"},"observation_digest":"sha256:4a3aeac83712a0df81aaa445e84a6656d3c8bfe69f0d96eac976a01f32d9e07a","observation_id":"33e2b1c3-99b2-4f9c-a1f8-9cc668a95aaf","resolution":{"observed_at":"2026-07-02T21:47:27.708321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:99656798842b0ad7581f6a42a16b4a1fd48d26e658864183aab4f8b2e33feea1","observation_id":"c4f2eab3-fea5-4e2f-845e-f7ef0c831a57","resolution":{"observed_at":"2026-07-03T01:57:32.398548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2606.12360","last_updated":"2026-06-10T17:31:16Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:31:16Z","title":"Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-27T10:32:57.295159Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2606.12360"},"observation_digest":"sha256:32343296bb79fe11ace498141b3500e7a5dfbb45e10c1e2cc11d502db831c00d","observation_id":"55d6c3bb-6377-4b1c-91a0-2aadc661fb90","resolution":{"observed_at":"2026-07-03T09:07:47.895988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2606.18164","last_updated":"2026-06-16T17:01:57Z","snapshot_observed_at":"2026-07-30T03:30:31.097644Z","submitted_at":"2026-06-16T17:01:57Z","title":"Learning Dynamics of Chain-of-Thought State Tracking in a Solvable Transformer Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T21:49:03.896740Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2606.18164"},"observation_digest":"sha256:a8ff5a26f931ccf1c833b8dfb3d8de36a2db2ce082b3cbd2836aee6fe4cd7072","observation_id":"a1c88b3d-f970-4ee2-a3c0-cf859e63efc9","resolution":{"observed_at":"2026-07-03T23:39:05.249303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2606.25234","last_updated":"2026-06-23T23:28:30Z","snapshot_observed_at":"2026-08-03T17:46:28.309569Z","submitted_at":"2026-06-23T23:28:30Z","title":"Structuring Sparsity: Block-Sparse Featurizers Capture Visual Concept Manifolds","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-06-25T23:54:29.531368Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2606.25234"},"observation_digest":"sha256:23b281a6dcb5074df55799025766bba0d65741264d1ef88343743ec105f2819b","observation_id":"0aff0b28-aaa9-421b-8ed5-7d955597a588","resolution":{"observed_at":"2026-07-04T17:09:58.962774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2607.01336","last_updated":"2026-07-01T18:00:11Z","snapshot_observed_at":"2026-07-31T02:51:36.591907Z","submitted_at":"2026-07-01T18:00:11Z","title":"Mechanistic Interpretability and Causal Feature Steering of Neural Quantum States via Sparse Autoencoders","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-03T20:16:48.256807Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.01336"},"observation_digest":"sha256:4ba3260389732203545c659067fc538110e037eb55f62b25b1dfa4b7866ca108","observation_id":"49197e46-f0cc-4439-ba2a-693b072f57a3","resolution":{"observed_at":"2026-07-03T20:18:55.788579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-07-12T03:00:02.282468Z","title":"Open problems in mechanistic interpretability.arXiv preprint arXiv:2501.16496,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03365","last_updated":"2026-07-03T14:22:05Z","snapshot_observed_at":"2026-08-09T07:26:01.747915Z","submitted_at":"2026-07-03T14:22:05Z","title":"Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T03:00:02.282468Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.03365"},"observation_digest":"sha256:489ce7eb86f266c925e46e43f803a05f34ce5ebe59e63233ffb294741c19dbf8","observation_id":"e20f4c55-112c-4abd-9bca-ff9adfac4a08","resolution":{"observed_at":"2026-07-12T03:00:02.282468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-07-11T20:51:42.052454Z","title":"arXiv preprint arXiv:2501.16496 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04222","last_updated":"2026-07-05T10:28:04Z","snapshot_observed_at":"2026-08-06T08:10:56.319776Z","submitted_at":"2026-07-05T10:28:04Z","title":"Unsupervised Features Mining via Activation Geometry","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T20:51:42.052454Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.04222"},"observation_digest":"sha256:0913539ba2e93369763c251278c0750b1f744518242f67d1b1b0929c2cf3642c","observation_id":"48c5a2a1-ba7b-4c2b-a206-d130a5e166fe","resolution":{"observed_at":"2026-07-11T20:51:42.052454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2607.07127","last_updated":"2026-07-08T08:14:21Z","snapshot_observed_at":"2026-08-05T20:29:25.967858Z","submitted_at":"2026-07-08T08:14:21Z","title":"Weight-Space Physics: Interpretable Hypernetworks for Lattice Quantum Field Theories","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T19:45:01.669063Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.07127"},"observation_digest":"sha256:74145b56f25e137b9af0417f819fa83159b3ee54e4da13891bf5a5ea41e51c5c","observation_id":"925f8d3b-88dd-4495-aa4a-3fe6e71c89fb","resolution":{"observed_at":"2026-07-09T19:46:28.683089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:2d9c41ca0277d3c0150859f4333c5020b6c9e60a90db0ca7d0fca109b785ce32","observation_id":"14bd7dad-d5fd-480c-9cea-ef3020aba4bc","resolution":{"observed_at":"2026-07-09T15:06:18.032089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-07-14T10:42:30.055074Z","title":"Open problems in mechanistic interpretability.arXiv preprint arXiv:2501.16496,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10578","last_updated":"2026-07-12T05:28:48Z","snapshot_observed_at":"2026-08-09T13:38:15.993719Z","submitted_at":"2026-07-12T05:28:48Z","title":"Laguerre Geometry for Interpreting Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T10:42:30.055074Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.10578"},"observation_digest":"sha256:7dcdf2a99a7a7edb53db9d3010fa25fe33587548755dfe691e83cb57c54cd863","observation_id":"8255463b-7d81-4aa7-a958-0bdf24a853db","resolution":{"observed_at":"2026-07-14T10:42:30.055074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T10:39:48.676625Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13047","last_updated":"2026-06-19T19:07:38Z","snapshot_observed_at":"2026-08-10T04:42:58.694391Z","submitted_at":"2026-06-19T19:07:38Z","title":"Targeted Recovery of Weight-Space Mechanisms From Neural Networks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T10:39:48.676625Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.13047"},"observation_digest":"sha256:23e2a6e4dda32318a5f4ee1907978c4a24049d94dfad92aeb43b0de4fddba06a","observation_id":"90bedcb2-6a35-442e-a894-69f72a24cca6","resolution":{"observed_at":"2026-08-02T10:39:48.676625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T10:40:03.484884Z","title":"J., Casper, S., Tegmark, M., Saunders, W., Bau, D., Todd, E., Geiger, A., Geva, M., Hoogland, J., Murfet, D., and McGrath, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13047","last_updated":"2026-06-19T19:07:38Z","snapshot_observed_at":"2026-08-10T04:42:58.694391Z","submitted_at":"2026-06-19T19:07:38Z","title":"Targeted Recovery of Weight-Space Mechanisms From Neural Networks","version":1},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-08-02T10:40:03.484884Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.13047"},"observation_digest":"sha256:4fb4555e23acf9d0b8b76bdcadd45899c3702cb8ae706fd0accc9abd3a467205","observation_id":"f612be05-850c-4c8f-bb3a-4aa956228a1b","resolution":{"observed_at":"2026-08-02T10:40:03.484884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T10:46:51.069511Z","title":"arXiv preprint arXiv:2501.16496 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14123","last_updated":"2026-06-18T21:46:20Z","snapshot_observed_at":"2026-08-07T13:18:38.777917Z","submitted_at":"2026-06-18T21:46:20Z","title":"Position: Explainability Research Must Prioritize Foundations over Ad-hoc Methods","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T10:46:51.069511Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.14123"},"observation_digest":"sha256:f6d0e181d51885065b970ec2291c855e6610e4e0fc998e29fbb9d28b1b0c17b3","observation_id":"83e2ae79-c125-498c-9332-d3f102e15528","resolution":{"observed_at":"2026-08-02T10:46:51.069511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T00:42:34.779473Z","title":"Sharkey, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14943","last_updated":"2026-07-16T12:52:49Z","snapshot_observed_at":"2026-08-09T04:12:40.610820Z","submitted_at":"2026-07-16T12:52:49Z","title":"Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T00:42:34.779473Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.14943"},"observation_digest":"sha256:6148cc806d3d2bde58890e6b7b761136d64ed26c906e9e142688689a13d21f8a","observation_id":"5c622027-b414-473d-abdf-cdeb1c968870","resolution":{"observed_at":"2026-08-02T00:42:34.779473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-01T17:18:44.974316Z","title":"arXiv preprint arXiv:2501.16496 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18348","last_updated":"2026-07-20T08:43:22Z","snapshot_observed_at":"2026-08-07T17:56:07.091442Z","submitted_at":"2026-07-20T08:43:22Z","title":"An Analysis of Residual-Stream Geometry Across Transformer Depth","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T17:18:44.974316Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.18348"},"observation_digest":"sha256:5b6b042c3fb38a361deefd8b562a169e074826552d544f89a53babdb1e1e893e","observation_id":"6250a2e1-3dde-4b5d-ba0e-b62f793ffa87","resolution":{"observed_at":"2026-08-01T17:18:44.974316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-02T12:14:23.380605Z","title":"arXiv preprint arXiv:2501.16496 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19364","last_updated":"2026-06-05T19:27:31Z","snapshot_observed_at":"2026-08-05T20:13:19.009303Z","submitted_at":"2026-06-05T19:27:31Z","title":"Statistically Grounded Sparse-Feature Interventions for Activation-Space Control in Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T12:14:23.380605Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.19364"},"observation_digest":"sha256:b44fe2d9c2aafcd3178a3212618f9416d0734cbdd7473df35700011cc04d2216","observation_id":"8675a0bb-2478-488f-99a4-f67be5a1fa3d","resolution":{"observed_at":"2026-08-02T12:14:23.380605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-01T12:16:42.768478Z","title":"arXiv e-prints , keywords =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19640","last_updated":"2026-07-22T00:21:36Z","snapshot_observed_at":"2026-08-04T21:04:08.236868Z","submitted_at":"2026-07-22T00:21:36Z","title":"AGNFormer I: Reconstruction of AGN spectra using a probabilistic transformer model","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-08-01T12:16:42.768478Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.19640"},"observation_digest":"sha256:c1c365b4ef28ad27f4faee012dc2eabf9bf88a908d6a1bb43a8ac67ab470455f","observation_id":"865ee866-0a31-4a2e-a205-505620e1f5a6","resolution":{"observed_at":"2026-08-01T12:16:42.768478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-01T02:27:03.485740Z","title":"arXiv preprint arXiv:2501.16496 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25459","last_updated":"2026-07-28T08:49:48Z","snapshot_observed_at":"2026-08-07T05:20:46.900960Z","submitted_at":"2026-07-28T08:49:48Z","title":"Emergent Latent-State Computation under Stochastic Volatility","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T02:27:03.485740Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.25459"},"observation_digest":"sha256:1a8ff064e45e9f95efe3a3dc8bdb27cb549c397dd78720bde4ce5ba4508e8409","observation_id":"084596d9-7682-4911-b82e-071205ac7e7b","resolution":{"observed_at":"2026-08-01T02:27:03.485740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-07-31T23:07:40.684953Z","title":"arXiv preprint arXiv:2501.16496 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27917","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-10T00:35:44.804679Z","submitted_at":"2026-07-30T09:30:03Z","title":"One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T23:07:40.684953Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.27917"},"observation_digest":"sha256:01843c1fda8a19561984eab1f9eaa2b9146abae5da39d015d21864cfadb67635","observation_id":"bcfd39c0-cf36-4cde-8840-92ba590592f8","resolution":{"observed_at":"2026-07-31T23:07:40.684953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16496/citation-record","integrity":"/paper/2501.16496/integrity","json":"/paper/2501.16496/citation-record.json","paper":"/paper/2501.16496"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.1907375117","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"a is b” fail to learn “b is a","venue":"Proceedings of the National Academy of Sciences","work_id":"6b96f855-8b1d-4fc1-8171-8e1a6a16fea9","year":2020},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:d40b9ec61595041733ff99ebb90d3090063a6edd85ca4b573acdddef3c2b017a","observation_id":"c923f1b3-d1fb-44db-bf56-0754c2c8918b","resolution":{"observed_at":"2026-05-14T18:30:06.027122Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.23915/distill.00015","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://distill.pub/2019/activation-atlas","venue":"Distill","work_id":"aa26f856-6ec2-4377-9256-be457f8d0629","year":2019},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:966e7e8ccfb6a6290e04edce725a4ec4b49389a19be95960b9abd563d27e03f1","observation_id":"7354f512-55a5-4d67-9115-d2a6c561d750","resolution":{"observed_at":"2026-05-14T18:30:05.975539Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00359","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:06.771457Z","title":"Transactions of the Association for Computational Linguistics9, 160–175 (2021)","venue":"Transactions of the Association for Computational Linguistics","work_id":"c60c9b79-a372-4ddc-a28f-4c6fa9d62204","year":2021},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:14723b39d40855a2b9f94402579e3291ad0d7f553243c0c968bc3c80a8d00988","observation_id":"4fadc288-2e14-48ae-a8f7-9d68faa121d4","resolution":{"observed_at":"2026-05-14T18:30:05.981712Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T04:38:19.13222+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T04:38:19.13222+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w16-2524","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the 1st Workshop on Evaluating Vector-Space Representations for NLP, RepE- val@ACL 2016, Berlin, Germany, August 2016","venue":null,"work_id":"48f79331-577a-482b-b14d-fcad29a5a94c","year":2016},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:a5c5b4d46be212af2681b7be6add7af35d7db387789f23f12c2c0cea2ed341dd","observation_id":"ce5c2ddc-2cd2-446f-aac3-3ad238d49f20","resolution":{"observed_at":"2026-05-14T18:30:05.986398Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1146.353307","doi":"10.1145/3531146.3533073","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"News from Generative Artificial Intelligence Is Believed Less","venue":"2022 ACM Conference on Fairness, Accountability, and Transparency","work_id":"1bb029ce-48e8-4920-9a76-a9d1d929a6b7","year":2022},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:3f4a2148a4a02d1dda921156ea6ce90ed2c16899b995c116b6c33efc50582891","observation_id":"71ac7d6e-65b9-481e-b224-208d9e84bcbd","resolution":{"observed_at":"2026-05-14T18:30:05.992913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T09:20:14.327066+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T09:20:14.327066+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1419","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Structural Probe for Finding Syntax in Word Representations","venue":null,"work_id":"0df838da-4239-4289-a192-331c05d37976","year":2019},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:f43b016d317321ab0e26eb147df344c8e4c2bf2d04d49b4f02666113b1bbe501","observation_id":"bc772c23-b7a3-4894-8ca1-5a6433b0f8ab","resolution":{"observed_at":"2026-05-14T18:30:05.997680Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:54.888346+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:54.888346+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.23915/distill.00029","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Backward Lens: Pro- jecting Language Model Gradients into the Vocabulary Space","venue":"Distill","work_id":"b5887b94-8060-4888-bcee-43e35b34119b","year":2020},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:b2cf37139f42ff0a19e8c0aabec265db61cb31983fb74f3211fb8bacc11d47fd","observation_id":"180db348-902e-4fbc-9ed3-0f0f732c27d9","resolution":{"observed_at":"2026-05-14T18:30:06.002546Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.0035","last_updated":"2014-11-26T18:51:52Z","snapshot_observed_at":"2026-08-04T19:41:57.485154Z","submitted_at":"2014-11-26T18:51:52Z","title":"Understanding Deep Image Representations by Inverting Them","version":1},"cited_work":{"arxiv_id":"1412.0035","doi":null,"metadata_source":"pith","pith_arxiv_id":"1412.0035","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding Deep Image Representations by Inverting Them","venue":"cs.CV","work_id":"674f2cd9-60d3-4733-bc14-ed0f341391a7","year":2014},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1412.0035","citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:87268ff639fda7cb7ca3a8becf37fd58018dec5ec04ffc6732cef85355f9dcac","observation_id":"876af1f0-0ae5-4f45-a4d1-626a50d64d18","resolution":{"observed_at":"2026-05-14T18:30:06.009807Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.23915/distill.00007","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://distill","venue":"Distill","work_id":"9bc4d2e5-4d21-424e-bd0f-820763bc70bb","year":2017},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:6346c3399a3691914704898ac680b460735a3b8045e657903e3fc32bed4001ee","observation_id":"e6c5ae18-3944-4aa7-b2f4-d55cf0c6692f","resolution":{"observed_at":"2026-05-14T18:30:06.016148Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05971","last_updated":"2024-04-09T02:59:17Z","snapshot_observed_at":"2026-08-08T22:26:42.111395Z","submitted_at":"2024-04-09T02:59:17Z","title":"Does Transformer Interpretability Transfer to RNNs?","version":1},"cited_work":{"arxiv_id":"2404.05971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05971","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonçalo Paulo, Stepan Shabalin, and Nora Belrose","venue":null,"work_id":"f2781463-6bc8-47ff-998d-16f4a9b0f3ef","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"cited_paper":"/paper/2404.05971","citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:ad6a34626458295f370a7799b07c7aadb5211c4aa7c33a3aca118ae9b76c9ae3","observation_id":"7861a7dd-40ac-4ba7-b676-e12f1258afe4","resolution":{"observed_at":"2026-05-14T18:30:06.053221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03947","last_updated":"2024-06-06T10:46:51Z","snapshot_observed_at":"2026-07-06T18:26:23.994796Z","submitted_at":"2024-06-06T10:46:51Z","title":"Weight-based Decomposition: A Case for Bilinear MLPs","version":1},"cited_work":{"arxiv_id":"2406.03947","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03947","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judea Pearl.Causality","venue":null,"work_id":"ee6341aa-5beb-4661-bfe9-de15ba08c0d0","year":2009},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"cited_paper":"/paper/2406.03947","citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:1ef51fe30cf2806c2d80c95a6bfad32ca9f9f79a8c836542a95407bd16ddf5bd","observation_id":"20d8ff8f-dcdc-44d5-b6fe-d6e676ea4ca5","resolution":{"observed_at":"2026-05-14T18:30:06.059231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.936","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jorge Pérez, Javier Marinkovi ´c, and Pablo Barceló","venue":null,"work_id":"ec2116f6-1262-49b5-a2c5-f5ba165ffcae","year":2023},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:4606b99786e82d200879d91f86d67231b0927d70be7542058138b04212f681f9","observation_id":"733c560a-3e06-47fb-b145-26325ebdae61","resolution":{"observed_at":"2026-05-14T18:30:06.031452Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-25T06:55:06.149625+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T06:55:06.149625+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/nn","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic models of large-scale brain activity","venue":null,"work_id":"6e565c1c-edb5-4d6f-8aff-23cd396efbcd","year":2017},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:61946333dd1b885cbd7a34e415e3d7df2dfc93ce5fbc1c28fe298dd59b30fab7","observation_id":"70f8a027-b816-4dcb-b739-657179aa7612","resolution":{"observed_at":"2026-05-14T18:30:06.036048Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/nn.3865","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"why should i trust you?","venue":"Nature Neuroscience","work_id":"a29fc0cf-20eb-46a8-bf24-76b23f1927e9","year":2014},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:f5210db5d9f03f1a6731712feef74f71e6837f20499cdfa6ce1103da739eee32","observation_id":"ed55669f-b1a4-48aa-8426-aafe99b3f707","resolution":{"observed_at":"2026-05-14T18:30:06.040799Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:10952f82dc0aae5625f7216e57153e8d856e30fd7eca37cbb0a26e04ce2dba43","observation_id":"070cb7c8-af62-4070-8a51-0c1eda90f730","resolution":{"observed_at":"2026-05-14T18:30:06.046857Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":"2310.01405","doi":"10.1609/aaai.v36i9.21196","metadata_source":"pith","pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","venue":"cs.LG","work_id":"45b326e2-e962-41a5-a542-2559e103a19b","year":2023},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:9cdd712b2c74ccd191231dc3640c0565df345b0cec8512d8277dff41b282a4ce","observation_id":"f996f9eb-11eb-4278-843d-81c8ac638337","resolution":{"observed_at":"2026-05-14T18:30:06.022244Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What isomorphism or what approximation of a neural network (or parts of it) is the best way to express it for the purposes of interpreting it? b","venue":null,"work_id":"4481b7d4-b2b5-42fb-a756-e6be3fc911d2","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:99acb3fce348184a731a7687635529ced5ea4870027484d2eb2411ad8d079ef7","observation_id":"54952ac5-de83-4b8c-a063-a89db4407a75","resolution":{"observed_at":"2026-05-14T18:30:06.280695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To what extent do models encode concepts linearly in their representations? b","venue":null,"work_id":"c71a4650-1d1f-4126-bf6e-5e1ec40f7df5","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:7c8a975256c60b866c2bc0bb920b4ba57d7d56bb0a18960747b6cb02695a40db","observation_id":"da960d65-d177-4de4-9691-917c2db17768","resolution":{"observed_at":"2026-05-14T18:30:06.285689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we fully determine the causes of feature superposition and polysemanticity within neural networks? b","venue":null,"work_id":"93763708-174f-4ce2-8c08-aefafc3e0273","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:6e9498dca400a480b2ebb9549ab157673afe2791c5829854421f05d6046ef954","observation_id":"7142ca1c-dfb2-4d16-a8de-fde20845a135","resolution":{"observed_at":"2026-05-14T18:30:06.290636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What lies in SDL reconstruction errors? Will the errors converge to zero with methodological progress? b","venue":null,"work_id":"3087bf74-d945-4903-9b58-5f59941d369e","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:4c4acb1518ad040974dc1f40a1c99528116a9594a36e32cb90b80bc3cbcd4aa8","observation_id":"d58e9275-d820-483a-9da2-2f3143118ea8","resolution":{"observed_at":"2026-05-14T18:30:06.296069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we identify the underlying functional structure of networks (which defines why acti- vations are located in particular geometric arrangements in activation space)? 75 b","venue":null,"work_id":"e8364ce3-8ff2-4efc-9de6-48d5963cb6cc","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:caad7b973b362f7820993a99b630cef0a22403fdca74c2aee0045a95c204c0dd","observation_id":"a2319578-15f4-401b-bac8-e2c4337e0c99","resolution":{"observed_at":"2026-05-14T18:30:06.300906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we distinguish parts of networks that underlie generalization from parts that underlie memorization? b","venue":null,"work_id":"05633814-7dd7-41c6-a03d-9d8efd9c6082","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:ad102de632100d48821a47dd80ee8a2924df8d57b1179373bda0fc6ac29d8033","observation_id":"8d551ff8-d059-43de-b77e-ffff049af662","resolution":{"observed_at":"2026-05-14T18:30:06.305547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpretability training: Can we train networks that are interpretable by default at low per- formance cost? b","venue":null,"work_id":"5aada1e6-0aef-49af-9049-0432a015ae0a","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:db21b3edda939cbade2cac3cf2eb3f040998a436a200eb6c008679f98801863f","observation_id":"36d6b044-49c1-4eb6-80f3-1e6deba5f818","resolution":{"observed_at":"2026-05-14T18:30:06.310467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we avoid imposing human bias to explanations? b","venue":null,"work_id":"893ed825-c6d5-4bd4-98d0-b777d3c29115","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:2f27968ef8b7e66209cdd2a720bb8593908c94c3596a05022b79fdcab6e1a503","observation_id":"ff490481-0010-4bed-bd44-30fa7397fec4","resolution":{"observed_at":"2026-05-14T18:30:06.315126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we develop attribution methods that capture higher-order effects beyond first-order approximations of model behavior? b","venue":null,"work_id":"552f9c94-23b4-4a57-9f65-b9e08c15bfc5","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:9147f99e1815db2fde332c27d69195c14bae9c3399e7131e0d3b5cae7a461ed5","observation_id":"9e7a2ef4-9d63-44c9-a977-cedc8afe1475","resolution":{"observed_at":"2026-05-14T18:30:06.319803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hydra effect","venue":null,"work_id":"123d241f-34da-497d-a9f0-de0fd16b4dff","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:175cbe9d7b4f3a70982590449e0c277b6f2d6d2b1df736e9bc30700ba29bdb6a","observation_id":"f48a12fc-9794-471d-9c2b-792212f06c56","resolution":{"observed_at":"2026-05-14T18:30:06.323908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we improve on methodologies for evaluating hypotheses through their predictive power on activations of network components? 76 b","venue":null,"work_id":"b9a79f0b-a6ae-425f-9a08-783d6f747ed4","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:55853bcc485c33957668779c5fdbc9f46e170666aa6870adaba5ecbd0c907f37","observation_id":"fd6a03bd-378f-4e78-89f1-3f6e4a18d578","resolution":{"observed_at":"2026-05-14T18:30:06.329061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"model organisms","venue":null,"work_id":"b52e30fe-f52d-49f0-8900-183d5459b219","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:712855c155eca6afd2577fb67651a846a1abd9af6316d87aa14490bc40e4fb85","observation_id":"dd7c3def-47e8-4f2e-bb90-b3d64c780245","resolution":{"observed_at":"2026-05-14T18:30:06.333830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c49f105f-8c01-4b36-a69f-dc63dc7dfb8d","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:4bbe68223654488074d8b068662efc1fcb48a98857879b7e6a211c375d5af32c","observation_id":"14e69a69-563f-4137-8d83-523996405b29","resolution":{"observed_at":"2026-05-14T18:30:06.338193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"stress tests","venue":null,"work_id":"a42f9cc1-99ba-42aa-8ca6-7ec2c6f50095","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:cb2d58391aa2401cc1575c3a212d213987b3ef07de05e6c0074888eeb718e2fa","observation_id":"f398f711-81c7-4a32-8a75-d7607e710b0d","resolution":{"observed_at":"2026-05-14T18:30:06.342427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10e6b71a-d4c3-45d4-b2dd-de98e7a5b6ab","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:e12621db6e55f1573215c90813b2220501ab6cfad8c0f6c4e036e85ac6aeb4aa","observation_id":"5755e2ed-f3ec-4928-9301-fafb589f72b5","resolution":{"observed_at":"2026-05-14T18:30:06.346926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c41fb21-f4ec-47af-ad8d-37eca183b498","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:bbc704cb2192d0d1b1abe2fa0e80d67cbfca5d0c7db2d50a71a27fb3c63e42ea","observation_id":"3d09aa42-1993-4b2d-b114-1e85c75fbec5","resolution":{"observed_at":"2026-05-14T18:30:06.063177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"889a3c86-4190-4b76-8903-c820510aa805","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:7c8e1e55b8d1bb9491cb619c92a9116d190a5b98abdc880b7d5cfbc897a7637c","observation_id":"78a8fd19-d816-4ed1-b2d3-11a009d9c3d4","resolution":{"observed_at":"2026-05-14T18:30:06.067203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"82ef7c23-183e-4083-a354-589b270c195c","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:1a5ec77fa2629480b81101d0cec8de1da336ca0092dfcda40505578173d8df15","observation_id":"922da718-ba11-4302-a220-746b459bc974","resolution":{"observed_at":"2026-05-14T18:30:06.070676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9dc5c5d-d72e-4eeb-a563-1996107fcfcf","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:d3760ec867af1bcebe41596f99c7582ad05f64a2a201acb1abac9370053ecd16","observation_id":"11234bc9-0d64-4d71-9d7f-4beef967e464","resolution":{"observed_at":"2026-05-14T18:30:06.074272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2cfc91ef-6817-469d-903e-2aad196d878f","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:1b820fa7c969a86df77a0d8640f9c3791ad432a2ef71c58decf763f36abf5fbd","observation_id":"b50fc385-f7fe-48be-8db6-451b216e4dff","resolution":{"observed_at":"2026-05-14T18:30:06.078001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"464dba5c-a2cf-45dd-a8ce-fa51a34a890c","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:ef5acc9f1d19a0130dce11a0a693adf874847fa85b59d011befa368fedcc28ff","observation_id":"637940f9-a503-4482-90cb-3e5c80dc51a3","resolution":{"observed_at":"2026-05-14T18:30:06.082145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5d2c97f6-71c8-4c11-8c57-9ae22881673c","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:c379bc8b61a652fe0c479b5758ee7aafcde6431d875e39e023d01f0574a875a1","observation_id":"aa50ed94-92f6-427e-8162-4156ae230790","resolution":{"observed_at":"2026-05-14T18:30:06.086866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Through automating the generation and testing of arbitrary hypotheses? b","venue":null,"work_id":"f73a6868-9b22-4fdd-a903-ed60f52e32a0","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:69bf4bc511f0d07eb645873be27840b63ae21779e8b05bdf8afb5a4f8867defe","observation_id":"8bf28823-4860-44f1-84e3-35126cae0eb5","resolution":{"observed_at":"2026-05-14T18:30:06.091151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"83a40035-f505-4a3a-8979-48f187df069b","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:6260c873a41d1bcacaa7f5d94a0a64fb75914280f46b1fb4e39c79d252bfd61f","observation_id":"0ded2bb9-d480-4386-aca4-edd1ff675b13","resolution":{"observed_at":"2026-05-14T18:30:06.095248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual interpretability research? b","venue":null,"work_id":"19c4a6fd-2a0e-4c2f-a71d-7193f033089c","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:565d5c8564718160cd61a7c544d18bb3f80abac93179395710c562dd0716c90b","observation_id":"52823d66-ce85-4cc0-b820-d9af4f453ed1","resolution":{"observed_at":"2026-05-14T18:30:06.099447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a2d0bf2d-7438-4987-923b-0c89706a8b70","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:5b6edde4980f22b1bb5c5e5c2e5a6cb4f43d90b72a3a47b067ffd7d424dc40ac","observation_id":"c3a19264-694e-4037-a5b4-474e804a300f","resolution":{"observed_at":"2026-05-14T18:30:06.103730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"white box","venue":null,"work_id":"1d24392c-8d4c-4e72-989e-f84706224a42","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:07ea7e3911a0b885b2fdbd236ef00f53a41bbf81be48cf2a6e146ba8f0f798a1","observation_id":"9ecbcb60-0529-4e4c-a37d-a64ba61aba85","resolution":{"observed_at":"2026-05-14T18:30:06.108001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we use interpretability insights to make red-teaming more efficient than current methods? b","venue":null,"work_id":"c6159b65-096d-4c83-af1a-e7df52e81191","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:fb8b5d58486ddeaad27a0b29a4c28a9f2e1820f2205a52a40eb6be1198f782d6","observation_id":"31489b22-e6cb-461c-a85a-8a970a972393","resolution":{"observed_at":"2026-05-14T18:30:06.112199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we get mechanistic anomaly detection to work? b","venue":null,"work_id":"af07e3ee-c497-4fab-a9c6-4edce390ff2a","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:0f7ec05848e8f4c4cbf3ab23a123112a0df8c92843effeb1559b3e19417b3331","observation_id":"f13ced3f-1e9e-4445-be0b-8dc8c21ce751","resolution":{"observed_at":"2026-05-14T18:30:06.116859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we make activation steering more precise and reduce its side effects? b","venue":null,"work_id":"f06c88be-161a-480b-8696-fa986ff6930b","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:02a3a278481895086c12166622823329d92f560ad813390532872a414d98a33f","observation_id":"0f10da81-f714-4635-b378-ae44210a6ada","resolution":{"observed_at":"2026-05-14T18:30:06.121134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Will carving the network at its true joints help us improve on model unlearning and editing? b","venue":null,"work_id":"954d4477-2e86-4bb3-a611-6cd695a89c29","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:4e9a8a488970f6c5eafea0060693d848d7ce9cf09eeffafe8493bcfc188dfbc8","observation_id":"8b6d10ce-c5c2-4d7a-bf3e-aa3687922b73","resolution":{"observed_at":"2026-05-14T18:30:06.125782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we make finetuning more sample-efficient by targeting specific parameters? b","venue":null,"work_id":"4e27cd9c-057d-4471-b6d9-bc47f1ec02f2","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:7bca0469a00abf9736a600d9c527e77484ea66a0616cbde9f707dc333070ddd2","observation_id":"e6a5ebc1-2fab-4852-b5b2-bd4e527cb3d3","resolution":{"observed_at":"2026-05-14T18:30:06.130380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"values” or “goals","venue":null,"work_id":"a9ebbe1d-5f71-4af6-bf35-5486993100e3","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:d83df6cf38d1afd1f0773fba242ff7e6e9797f64cbb7269b6c8f9b361f4ae153","observation_id":"f5db5b02-b6a8-48cf-b942-2c704909d5a9","resolution":{"observed_at":"2026-05-14T18:30:06.134966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can current toy model verification approaches scale to frontier systems? b","venue":null,"work_id":"61771aa4-9852-4d25-8bda-25283597c823","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:cb63aba31455eb8323378a964106ebd759803adb6bab3cb3e5bff5d1e299191c","observation_id":"2a194e14-6273-4935-a009-8d463633ad6d","resolution":{"observed_at":"2026-05-14T18:30:06.139686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"enumerative safety","venue":null,"work_id":"4715f95b-bac0-4bcc-931e-9590218e15c2","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:cb3eb75c9eebccca63b2d8db84cfeb1b300eedc3f727c3e2c75961306783303b","observation_id":"fa1f6919-6fdf-4a9a-89e5-a397efe4dd9a","resolution":{"observed_at":"2026-05-14T18:30:06.144570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we identify early signatures that predict emergent capabilities? b","venue":null,"work_id":"2d054909-06f8-461d-a4d5-7d4d3f3b5230","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:d33d7e8d4943140ec89e2445ff2ac7902299de3da48a01d5e52503241013a484","observation_id":"728fdd09-3a9b-42b8-a986-10b2fb668575","resolution":{"observed_at":"2026-05-14T18:30:06.149503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How do specific training examples influence the development of model mechanisms? b","venue":null,"work_id":"82432b04-f3bd-405d-b704-be432031765b","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:5e1ecbc04a87506ea8c3410a1b07ff64a70962e2e27b08260a4a1a6b8ad6d50a","observation_id":"6b570a64-7e75-431d-9ed9-27766a82bba9","resolution":{"observed_at":"2026-05-14T18:30:06.154069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we identify capabilities that could be ‘unlocked’ through prompting or finetuning? b","venue":null,"work_id":"f80e8f08-159d-44be-a90f-98b8966685c2","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:1031fcc3fa2fd8eb1b019dbd392ad8c405aed507ae052950297c04eb196e18c4","observation_id":"13bb5b87-ec8d-4a56-9fca-436aca87e015","resolution":{"observed_at":"2026-05-14T18:30:06.159176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we identify skippable computations without affecting outputs? b","venue":null,"work_id":"f76a7a34-9f14-4f44-ad36-6fb2d2ee7e4c","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:3c0c90dabed5fe4c63aeb5701d0b889818e35111de9f47af17ba9d09d2194092","observation_id":"37a55358-fc99-42e2-a397-27f2d166fddb","resolution":{"observed_at":"2026-05-14T18:30:06.164006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we better select training data by understanding example influence? b","venue":null,"work_id":"05733b5d-a56d-414e-bb8f-ae843ff4b59a","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:dbc1cf34a09739ad3e83f356cebbe28805e013afcf76ae13c5d4a0826146ad02","observation_id":"8b60cb08-2fab-496f-8d13-6a95b5940da0","resolution":{"observed_at":"2026-05-14T18:30:06.168949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we design better inductive biases based on mechanistic insights? b","venue":null,"work_id":"68ae36b9-9080-4ef5-ab24-004ebe8d9349","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:6643ee9707df30bf67f31eca9f95f6855dbd12c765b853d0382a08ec316295ef","observation_id":"c7249d5b-baab-4110-aa85-0493b5c0c1b0","resolution":{"observed_at":"2026-05-14T18:30:06.173860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we extract novel patterns and predictors that models have found? b","venue":null,"work_id":"d7fd818f-f22d-4be5-a464-24b2bc08a003","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:76ec9741bc4be883f7fd5f419fdeb94fe61e82173e2a57f2760ef886bfccaf45","observation_id":"f4d30f0b-e153-498a-b3d3-3ade9cc32070","resolution":{"observed_at":"2026-05-14T18:30:06.178610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we detect when models have found genuinely novel patterns? b","venue":null,"work_id":"3ef2527a-2331-422f-9206-b540c9f1b211","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:0096aa0447ba0e8103f9906844ec0e2d0a65668d512691914e231b2ee2dab327","observation_id":"c8b34bf7-027d-47e8-bd4a-a014a73240a9","resolution":{"observed_at":"2026-05-14T18:30:06.183194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do current interpretability methods (SDL, circuit analysis) transfer to SSMs? Or, like the transition from CNNs to transformers, are new approaches necessary? b","venue":null,"work_id":"4d11c133-076c-4654-9a14-e6d5320b7d20","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:2f163c9e62d2fd4f80c73faeaaabb14c4034a7af72500c34eaec8c3e7e717d5b","observation_id":"33032b8d-fdb0-466b-b15d-49507245f6df","resolution":{"observed_at":"2026-05-14T18:30:06.188174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"universality hypothesis","venue":null,"work_id":"a41ec883-b7a4-4e84-9b63-8179dd4e8417","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:e5e99f8d1ca4ebf9007817f1223d8e77195847e75153cb2dd808032b706285ae","observation_id":"69a1577f-00cd-4909-9ec1-89990f4a40b1","resolution":{"observed_at":"2026-05-14T18:30:06.192701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we prepare for interpreting novel architectures? b","venue":null,"work_id":"e79cb0c4-0dda-4782-bee5-d16159ef1f67","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:287571fc4c6a05094b84ef98853e987ce6ff6988fedddac95d3a30a80facd712","observation_id":"4e14c264-7a9e-4bce-8376-98e1ac11da50","resolution":{"observed_at":"2026-05-14T18:30:06.197493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we visualize model internals in an intuitive way? b","venue":null,"work_id":"53ba5aab-19b6-47ce-b64d-db8034172c27","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:75ce9d78e9c903d3ea8a255d032951d33e00bedac080ba1ee9b9fde1490df162","observation_id":"c22ca0a1-8991-4a95-9a91-e92da7086776","resolution":{"observed_at":"2026-05-14T18:30:06.202163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we help auditors find potential failure modes directly? b","venue":null,"work_id":"4ac5d3e9-691f-42dc-b047-5a27001fce18","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:34285de25da945cca458cc89b4db30780b7cd9449860230707ba8115fd511184","observation_id":"82fb5570-d563-41fe-88ef-ba5c209fc2a3","resolution":{"observed_at":"2026-05-14T18:30:06.206840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can transparency features help users calibrate trust? b","venue":null,"work_id":"50d5b4bb-afdd-4987-8dd8-bf9c5c7644b9","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:a9361efe6d930f2b54cb62fbc109735a19a5d3a2496438aeda0529fa4f03bda7","observation_id":"f436bcc4-edee-4330-beb8-e88787400224","resolution":{"observed_at":"2026-05-14T18:30:06.211425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we identify specific mechanisms that caused AI failures? b","venue":null,"work_id":"710b5e8a-c6a0-4777-ad83-b4ac5d54a537","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:222f99627c4437ee4e15db1dbc77126bbe4a4920142e3b2aeaa1fd439f3aef0e","observation_id":"0d343568-e0b4-45fa-8cf9-4d0c8cdc4f94","resolution":{"observed_at":"2026-05-14T18:30:06.216371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we identify mechanisms responsible for specific dangerous capabilities? b","venue":null,"work_id":"a3239bca-043b-4f47-a0a1-5647180d0d42","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:189adf6eb6879a560417682dc40e98a70d82081a25a1d11953adf8993148b64f","observation_id":"82df408c-34da-491c-b04a-a1ac5813ebbf","resolution":{"observed_at":"2026-05-14T18:30:06.220973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we trace decision mechanisms to explain model outputs? b","venue":null,"work_id":"c07f091a-7775-43dd-88c4-e243a220234f","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:bab9d79aaacad009a8234e640e1c462db46a65922f01e10363ef1f5ea851e4be","observation_id":"d8058ef9-d43e-4b2b-9631-ea40fe3ceee4","resolution":{"observed_at":"2026-05-14T18:30:06.225663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we use interpretability to improve capability elicitation? b","venue":null,"work_id":"2865d475-2909-4cef-ae68-648af5cba8d2","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:559c22299bf88d5c78ccba1de1ba1ab0a3c2355990a5c2e91896f973842a0953","observation_id":"bc0c733c-5cbb-4c36-b777-d2b2dcbec6c3","resolution":{"observed_at":"2026-05-14T18:30:06.230699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"21873a91-32e1-4975-bc60-087108a422e0","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:55482ab41edd3c60f3f73a952cc89f582bc611b0ab32e0e6c0ef2077d898b93e","observation_id":"f2b53f9b-7b37-4726-9e0c-6494fb436bb7","resolution":{"observed_at":"2026-05-14T18:30:06.235543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce246c07-6043-4667-bea5-850875f3c191","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:79b0ed31c241abb161e64e19de1b37173822dcc09599b1a292ceadd47ba12846","observation_id":"206c09bb-3a8c-48d7-94ba-404764a8ce0c","resolution":{"observed_at":"2026-05-14T18:30:06.241536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can we use interpretability to construct reliable test-time monitors to detect AI incidents? b","venue":null,"work_id":"52afdd35-85d7-48c0-bc63-71e28efa54a7","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:2d0e31290dd9558b9b4d72c9e0bd65ba897c487130137820705392a8277db1bd","observation_id":"3809b625-05f9-48e9-8ca7-ce838f0fa2e8","resolution":{"observed_at":"2026-05-14T18:30:06.246817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c6992fc-469f-4ca6-ab1d-8db083000d47","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:362ac588d12a8b692346f8ee39036eab97fa32a84f4173a0f9f530bee496a489","observation_id":"ac916f48-a562-4c95-8c4e-9a524698ab0a","resolution":{"observed_at":"2026-05-14T18:30:06.251798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"86233b4b-b1ba-4c1b-8a59-223e8bb9902a","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:a7a1c42c23208ebf05d14a478639bb3e9c3571450f5316746f953d603daa5bb8","observation_id":"10336af0-81e7-4135-b1ee-ddffd0bd86e8","resolution":{"observed_at":"2026-05-14T18:30:06.258796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4a26c369-7ba3-4d7e-aa90-408578ae9c9e","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:ea4e61c2766d7fdb86eaf50e7481ff39525425ad5097d63aa6f91883dbc9df5b","observation_id":"874cc514-7cfe-4dde-a966-281ce07afc48","resolution":{"observed_at":"2026-05-14T18:30:06.264148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What are the goals of the field? b","venue":null,"work_id":"06cf634a-921c-48e6-8acc-a1f7a4d81f56","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:04646fc14fd43b5ce901f97cfd3eabacb78ee386db1645c22145cf22c9f8720e","observation_id":"0ef76cd7-ad95-446a-9abc-d601c6cc535e","resolution":{"observed_at":"2026-05-14T18:30:06.269607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we communicate the results of our research such that the risk of their misuse is minimized? 82","venue":null,"work_id":"62c719df-0835-4a5b-9610-c2a6ae70a18b","year":null},"citing_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-14T18:30:05.914095Z"},"links":{"citing_paper":"/paper/2501.16496"},"observation_digest":"sha256:ae8aa96b454e448892032f4ae835433c83d3d7855437239f194de44df28b4b21","observation_id":"0594a943-fa8a-4b6e-9744-2a116cc5c8cb","resolution":{"observed_at":"2026-05-14T18:30:06.275564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":16,"verified_exact":8,"verified_fuzzy":45},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 100 inbound Pith citation observations for arXiv:2501.16496."}