{"as_of":"2026-08-11T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e42c318879b53b3e42a8c1414f342788cea3f5f8cf21cd7c8ac6448f81bcc62e","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T14:58:58.363330Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07316/citation-record","integrity":"/paper/2607.07316/integrity","json":"/paper/2607.07316/citation-record.json","paper":"/paper/2607.07316"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.057826Z","title":"Unboxing the black box: Mechanistic interpretability for algorithmic understanding of neural networks,","venue":null,"work_id":"e490c56a-4a4d-4e2d-aef7-272a95a52c64","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:446b0bf9a7b14e016a437cc2cdea734d10c3306cd36b5dcb6ec5b69a0ccc3879","observation_id":"0a8a6d68-bfe8-4406-9685-7ed44b353349","resolution":{"observed_at":"2026-07-09T15:06:18.059376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11180","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.052715Z","title":"arXiv preprint arXiv:2602.11180 , year=","venue":null,"work_id":"cf700e28-9b88-4476-a2ea-971be54f1bf6","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:cbdce793085ff3f0c7ed3fa9705b8cd4ef4989ba7243e3436967b08b996549df","observation_id":"335bcf68-0073-4ba1-ab13-2998315e7442","resolution":{"observed_at":"2026-07-09T15:06:18.054286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.956839Z","title":"A mathematical framework for transformer circuits,","venue":null,"work_id":"dd294ff6-cd4b-409a-85de-845722ab02fc","year":2021},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:2123dbeed25c46cfb5114461f9f7d5ccd58f7ce44aabc25591e9142550e0c147","observation_id":"f799cb1e-c1e7-4365-b8c7-96e9e3dcabe0","resolution":{"observed_at":"2026-07-09T15:06:18.959455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17023","last_updated":"2025-04-23T18:09:06Z","snapshot_observed_at":"2026-08-07T15:59:45.595636Z","submitted_at":"2025-04-23T18:09:06Z","title":"What Makes for a Good Saliency Map? Comparing Strategies for Evaluating Saliency Maps in Explainable AI (XAI)","version":1},"cited_work":{"arxiv_id":"2504.17023","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17023","snapshot_observed_at":"2026-07-09T15:06:17.993916Z","title":"What Makes for a Good Saliency Map? Comparing Strategies for Evaluating Saliency Maps in Explainable AI (XAI)","venue":"cs.HC","work_id":"495d18d7-01f7-4a73-8852-d7534e56b306","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2504.17023","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:daed77e1bba0e140accdbe2d5f7d6f369860d49a04f0ae54b8e3f8f2da210221","observation_id":"91ef92df-e4ff-4abe-a16e-1f4a50db67f5","resolution":{"observed_at":"2026-07-09T15:06:17.995144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.952117Z","title":"A perspective on explainable artificial intelligence methods: Shap and lime,","venue":null,"work_id":"00cde449-a59b-48a3-8ca0-c9ff95d0e03d","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:e1274e97aec41c1f5c3b6fc3038cf8d210d85e9574060f763dfb84b668fbaad2","observation_id":"81ffb238-3df7-4477-be95-8b9594f07424","resolution":{"observed_at":"2026-07-09T15:06:18.953594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/aisy","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:17.881045Z","title":"Walker, Christos Bergeles, Kai Xu, and Dragos A","venue":null,"work_id":"4fe7e45c-f47a-4704-b7be-5a058c393f97","year":2021},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:0493d99abe2a975ea3b804e990f526c4d14f40b09b30f3a7e1c38f28d47a7703","observation_id":"f6e53894-027e-4bc5-b666-56a00db6f6c8","resolution":{"observed_at":"2026-07-09T15:06:17.890477Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":"1610.01644","doi":"10.48550/arxiv.1610.01644","metadata_source":"pith","pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding intermediate layers using linear classifier probes","venue":"stat.ML","work_id":"bdc944db-4be2-44f7-950b-eaef12fab00e","year":2016},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:e39eb4fe8e0c02509c2db4f969d3b2ad70f8036f2c52fb550525ead87234cad4","observation_id":"3f44b898-5aec-45be-b593-d32a93f74ed2","resolution":{"observed_at":"2026-07-09T15:06:18.075143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:53.806491+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:53.806491+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02679","last_updated":"2019-04-11T16:00:53Z","snapshot_observed_at":"2026-07-06T07:43:58.268776Z","submitted_at":"2019-04-04T17:32:49Z","title":"Visualizing Attention in Transformer-Based Language Representation Models","version":2},"cited_work":{"arxiv_id":"1904.02679","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.02679","snapshot_observed_at":"2026-07-09T15:06:18.061686Z","title":"Visualizing Attention in Transformer-Based Language Representation Models","venue":"cs.HC","work_id":"fadc1959-d5f1-4c7f-bb62-9f6e6df319a0","year":2019},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/1904.02679","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:4b445e9fdd48f89e3866073423072d2d689f5f09492cf5185ff63d5d3ea93a20","observation_id":"2223e21b-8d10-4db0-a66d-e6e6c3710765","resolution":{"observed_at":"2026-07-09T15:06:18.063401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7326/m18-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:17.891786Z","title":"Estimating the attributable cost of physician burnout in the United States","venue":null,"work_id":"bc009b06-d490-48e6-be4a-7fba27681764","year":2018},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:7b5c575314c330b0871177f873d290dc4b65e67cf70e29e62d35e8f13737a433","observation_id":"7d54d782-7e17-466b-9d7a-fe8e82495fd3","resolution":{"observed_at":"2026-07-09T15:06:17.894409Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.948562Z","title":"Scoping studies: towards a methodological framework,","venue":null,"work_id":"37cefdb1-7df5-433b-a276-d9f42b81f0cb","year":2005},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:2f921230a32d9487d4c5ff88fe1711805b4b0d18673b04072d9fa28c49e61fc0","observation_id":"63e459a5-fdc2-47d6-a1b2-3e619a87c3e1","resolution":{"observed_at":"2026-07-09T15:06:18.949711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.950307Z","title":"Circuit tracing: Revealing compu- tational graphs in language models,","venue":null,"work_id":"e15c33e4-5bf0-4e70-ae27-ebca9f01aa6d","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:85cfa51970161d1c0189804f45c134cd89455adcf7635b1c48c3d105baf420f9","observation_id":"133eccda-181d-4f01-ae74-3dc121766737","resolution":{"observed_at":"2026-07-09T15:06:18.951469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2501.16496","doi":"10.48550/arxiv.2501.16496","metadata_source":"pith","pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open Problems in Mechanistic Interpretability","venue":"cs.LG","work_id":"f55f2189-55b1-4a1c-acfb-a5fa7bfa9e86","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:3671eeadf280f006aa660d712995bf3637716fa4a3698c2c4c1f1a7d3453eca5","observation_id":"14bd7dad-d5fd-480c-9cea-ef3020aba4bc","resolution":{"observed_at":"2026-07-09T15:06:18.032089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.960000Z","title":"Transformerlens,","venue":null,"work_id":"cff2f2e4-a769-456e-91a6-62f079b85ae0","year":2022},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:ef5c0b2eebe6d58c9d670895adc91e2339a46c57a77ba396dc48205ca53df10b","observation_id":"a9f87277-4a1b-4803-a749-0ca9dfb11091","resolution":{"observed_at":"2026-07-09T15:06:18.963389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.25060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.081228Z","title":"On the geometry and topology of representations: the manifolds of modular addition,","venue":null,"work_id":"d9d5ca75-19c7-4f41-8a89-6cc3998fa563","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:7e73a9fefd79e4bf54ea728df0f8a3b559ee964b9ea4bd86dee37145c61afb81","observation_id":"f50ba8a5-68c7-4a34-b109-163bc5f97de4","resolution":{"observed_at":"2026-07-09T15:06:18.082796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07129","last_updated":"2024-04-10T16:07:38Z","snapshot_observed_at":"2026-08-11T00:46:14.923912Z","submitted_at":"2024-04-10T16:07:38Z","title":"What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formation","version":1},"cited_work":{"arxiv_id":"2404.07129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07129","snapshot_observed_at":"2026-07-11T01:27:45.952692Z","title":"arXiv:2404.07129 [cs]","venue":"cs.LG","work_id":"c142de73-7921-41a0-9b3c-fb9ef3a08cd1","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2404.07129","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:e80037385c7c491fd1e12bcbbcee4bdcdb2b2ddb47eef83f2e0fbc3819e1d2c2","observation_id":"d43f212d-0589-46af-8853-0a3dde432882","resolution":{"observed_at":"2026-07-09T15:06:18.093603Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":"2209.11895","doi":"10.1145/3411763.3451760","metadata_source":"pith","pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-context Learning and Induction Heads","venue":"cs.LG","work_id":"db2b0911-2758-4a2a-99dc-15b14b91bd5e","year":2022},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:71345db9a9455a8c4843640cfdfa22fcd115d8fc30cbce999c2f8838f47c32b7","observation_id":"7b91a292-631d-441c-b89c-fdddee3ead41","resolution":{"observed_at":"2026-07-09T15:06:18.090840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":"2211.00593","doi":"10.48550/arxiv.2211.00593","metadata_source":"pith","pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","venue":"cs.LG","work_id":"d1167c73-3f2a-472b-8bf5-0ec282d7988a","year":2022},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:d78ce514504f3faba9782726ff9e4a754254463add4a96e223cb37119897a800","observation_id":"b329d57e-76b8-42b5-9bfb-857c5baae12b","resolution":{"observed_at":"2026-07-09T15:06:18.040273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14008","last_updated":"2024-07-22T02:13:58Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T03:45:27Z","title":"Investigating the Indirect Object Identification circuit in Mamba","version":2},"cited_work":{"arxiv_id":"2407.14008","doi":"10.48550/arxiv.2407.14008","metadata_source":"pith","pith_arxiv_id":"2407.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Investigating the Indirect Object Identification Circuit in","venue":"cs.LG","work_id":"8d48c229-d2f2-4228-9412-6a21c701ea60","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2407.14008","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:015045a872bf9678c6fe9069d3b88502e95e8c6035d49a1d3214a77922eee68c","observation_id":"e5e570f7-f9a1-4573-b3be-e09adfb38e8b","resolution":{"observed_at":"2026-07-09T15:06:18.085288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.25013","last_updated":"2026-06-29T14:56:29Z","snapshot_observed_at":"2026-08-09T23:47:58.930784Z","submitted_at":"2025-10-28T22:25:19Z","title":"Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers","version":2},"cited_work":{"arxiv_id":"2510.25013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.25013","snapshot_observed_at":"2026-07-09T15:06:18.078917Z","title":"Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers","venue":"cs.CL","work_id":"14676b70-c1ca-4a1f-99a1-cf45bf17810a","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2510.25013","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:a3085204f3c4062102336f84a90416c150568da7a95d6c9a3a174020d0a75d4c","observation_id":"b606e068-68d0-4af2-8390-d79275e856b1","resolution":{"observed_at":"2026-07-09T15:06:18.080095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14997","last_updated":"2023-10-28T20:05:52Z","snapshot_observed_at":"2026-07-06T15:21:19.790554Z","submitted_at":"2023-04-28T17:36:53Z","title":"Towards Automated Circuit Discovery for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":"2304.14997","doi":"10.48550/arxiv.2304.14997","metadata_source":"pith","pith_arxiv_id":"2304.14997","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":"cs.LG","work_id":"8407204b-a28a-4ba8-ae13-e7c04d3497c4","year":2023},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2304.14997","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:124c753c31124b587017de640a879d4db3b489a3ab15c08291ecc8efd218ed74","observation_id":"44d33f06-a2b5-4278-847a-5d8abde742ba","resolution":{"observed_at":"2026-07-09T15:06:18.046309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.973441Z","title":"Efficient automated circuit discovery in transformers using contextual decomposition,","venue":null,"work_id":"efb00272-86d4-4dc3-84ca-e9fd5ecf30f9","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:99284a46c3152ea2eb3dbb9f3179bfb702028b6a7e63b2cb4c7afc7e9b6904b4","observation_id":"9d3d5443-63d6-4341-a8a0-04feb2f5101d","resolution":{"observed_at":"2026-07-09T15:06:18.975300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00886","last_updated":"2025-03-02T08:26:23Z","snapshot_observed_at":"2026-08-03T07:57:07.814091Z","submitted_at":"2024-07-01T01:12:20Z","title":"Efficient Automated Circuit Discovery in Transformers using Contextual Decomposition","version":3},"cited_work":{"arxiv_id":"2407.00886","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.00886","snapshot_observed_at":"2026-07-09T15:06:18.080244Z","title":"Efficient Automated Circuit Discovery in Transformers using Contextual Decomposition","venue":"cs.AI","work_id":"77d92ead-4478-4822-9a3b-1a31ad3b0c7f","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2407.00886","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:f1aa716d4f67d07fde7fff615079f4348e422e4a78b7516d735bc308a6af0be6","observation_id":"2883b690-0e48-42d1-bc40-8d59d882bfe8","resolution":{"observed_at":"2026-07-09T15:06:18.081558Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.976078Z","title":"Pahq: Accelerating automated circuit discovery through mixed-precision inference optimization,","venue":null,"work_id":"960bcfaa-1577-43e4-bb56-3ef2a37794d1","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:404320c17e3c854a51b68b7133c7b1296a74f2a88b08eb9e48827afd3b653e3a","observation_id":"f70448e4-0fe1-49ba-a2dd-6ffc4785b611","resolution":{"observed_at":"2026-07-09T15:06:18.977689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.094717Z","title":"Available: https://arxiv.org/abs/2510.23264 7","venue":null,"work_id":"f8cc4bd2-fbf7-4afe-b370-d20a90023b2e","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:8eb18b04bdc3f2f031a7eb9ca59b07d5e4728297df9fcaf180603b64199f998f","observation_id":"a4a04406-1fa7-43c5-b351-448841c485c0","resolution":{"observed_at":"2026-07-09T15:06:18.096417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.041621Z","title":"Reinforcement learning fine-tuning enhances activation intensity and diversity in the internal circuitry of llms,","venue":null,"work_id":"2ed024c8-4c90-4eed-adc7-79be251818bc","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:103d0743b44f9635a05c0ee2fb3be848e866153c33c34aa25ef636d16087a476","observation_id":"ca41d87d-bee1-4123-9402-a5533041be43","resolution":{"observed_at":"2026-07-09T15:06:18.043477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.978530Z","title":"Information flow routes: Automatically interpreting language models at scale,","venue":null,"work_id":"2ea4f438-dbeb-4171-8c4b-1a9ef507a304","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:c695b505d29f824e3593afd242b117e823130cd31e1911456862f2e056baf94f","observation_id":"ac80940c-7da5-44f4-812f-40177e46e9ed","resolution":{"observed_at":"2026-07-09T15:06:18.980416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11917","last_updated":"2024-06-30T00:52:49Z","snapshot_observed_at":"2026-08-07T11:08:47.977754Z","submitted_at":"2024-02-19T08:04:25Z","title":"A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task","version":3},"cited_work":{"arxiv_id":"2402.11917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11917","snapshot_observed_at":"2026-07-09T15:06:17.991301Z","title":"A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task","venue":"cs.LG","work_id":"ff368bfc-8b2b-4850-b996-032370ddf75a","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2402.11917","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:6d2cdb71c9139621bbcabfaaf558fab32851af14ca6b7ad94bd821eb04674004","observation_id":"e3c36992-318a-4a23-a5a6-305eff92a5d2","resolution":{"observed_at":"2026-07-09T15:06:17.992693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.992486Z","title":"Emergent symbolic mechanisms support abstract reasoning in large language models,","venue":null,"work_id":"43d0275d-666b-48f3-810d-8651dc0cbf7a","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:05e00e35955c5ed0c111098069ceba9b6d845eb429ee975e52eeba8e35f7d4d0","observation_id":"64692f95-270b-4d37-9075-c10c0e586235","resolution":{"observed_at":"2026-07-09T15:06:18.993990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14925","last_updated":"2026-04-16T12:10:08Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T12:10:08Z","title":"Improving Sparse Autoencoder with Dynamic Attention","version":1},"cited_work":{"arxiv_id":"2604.14925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14925","snapshot_observed_at":"2026-07-09T15:06:18.008399Z","title":"Improving Sparse Autoencoder with Dynamic Attention","venue":"cs.LG","work_id":"1093bda3-6fc8-45f5-a807-1f40bddd5695","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2604.14925","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:174d0ba944da964205ce722b90af8e1105287d7eaeec4fa788e9c6daa404c01b","observation_id":"9bcdee38-5b1e-4fad-80dc-ed56c40c4eea","resolution":{"observed_at":"2026-07-09T15:06:18.009978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:19.000430Z","title":"Mechanistic interpretability with sparse autoencoder neural operators,","venue":null,"work_id":"a60646e1-a81f-4132-a349-255b0e45411c","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:33f5d33da2522315dc54b444e19f608c36521e6ca301697acce86813a468f8d7","observation_id":"a3808a72-2861-4e9f-8d45-01916f5cdf70","resolution":{"observed_at":"2026-07-09T15:06:19.001846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03738","last_updated":"2026-05-07T18:16:13Z","snapshot_observed_at":"2026-07-06T22:23:10.158908Z","submitted_at":"2025-09-03T21:57:03Z","title":"Mechanistic Interpretability with Sparse Autoencoder Neural Operators","version":4},"cited_work":{"arxiv_id":"2509.03738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.03738","snapshot_observed_at":"2026-07-09T15:06:18.076380Z","title":"Mechanistic Interpretability with Sparse Autoencoder Neural Operators","venue":"cs.LG","work_id":"eda24444-c77c-4ddd-8f0f-4675b8924a12","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2509.03738","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:ae276492d077aad51588960347375086be1031662a3d5fd59028a38bedbb1a37","observation_id":"2f2cf6b8-dff7-433f-aac9-8e9fd179ccd2","resolution":{"observed_at":"2026-07-09T15:06:18.077625Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":"2209.10652","doi":"10.48550/arxiv.2209.10652","metadata_source":"pith","pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toy Models of Superposition","venue":"cs.LG","work_id":"43875dbe-bc2d-4ab5-af63-744411533ff7","year":2022},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:bbeec0e9cbd696a929a0c7d9acf13081629591d92a488643f4ba544b40e66642","observation_id":"d28f71f1-9dcb-4d8f-8fb2-44acf8d5cd49","resolution":{"observed_at":"2026-07-09T15:06:18.072279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.960210Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning,","venue":null,"work_id":"50b0225b-ae6f-4d81-a37e-7903b73b1939","year":2023},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:581cef5a87d97523cf0725824172280edb2d5f98642e42c4c921792ccaa528ba","observation_id":"7d6f4be9-dff7-4329-b336-b34f5fc6d09c","resolution":{"observed_at":"2026-07-09T15:06:18.970387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01610","last_updated":"2023-06-02T21:52:17Z","snapshot_observed_at":"2026-08-09T07:24:01.957644Z","submitted_at":"2023-05-02T17:13:55Z","title":"Finding Neurons in a Haystack: Case Studies with Sparse Probing","version":2},"cited_work":{"arxiv_id":"2305.01610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.01610","snapshot_observed_at":"2026-07-09T15:06:18.074949Z","title":"org/abs/2305.01610","venue":"cs.LG","work_id":"839f946c-c7ef-4cc9-8c88-07660905dbb6","year":2023},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2305.01610","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:8c6e8d3f0d4e4ab58075dd5b36fe1d3460667e6bcbaa0876bcf87a1c5a6a78a1","observation_id":"f5b2eb1b-1fb1-44ad-950b-e4e237767793","resolution":{"observed_at":"2026-07-09T15:06:18.076196Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.970778Z","title":"Scaling monosemanticity: Extracting interpretable features from claude 3 sonnet,","venue":null,"work_id":"ba7f739a-303d-4e59-b9c5-89b84e99a59d","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:a0f600b0f791fc96738d7d685dbc7d05f8887bd4aceaddd5525766c5679850c1","observation_id":"ffcb526e-c0fe-4bb6-9880-66796529f848","resolution":{"observed_at":"2026-07-09T15:06:18.972674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":"2408.05147","doi":"10.48550/arxiv.2408.05147","metadata_source":"pith","pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","venue":"cs.LG","work_id":"90aa1ebe-ab2b-4462-adfd-047832493655","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:4f6c410535d739d1e49b96dd97cab017e2dc32334acfd683ff22b332bfef552c","observation_id":"7ea73d2a-9bc0-4859-993c-1d5d69319310","resolution":{"observed_at":"2026-07-09T15:06:18.005735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.05613","doi":"10.48550/arxiv.2503.05613","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.05613 , year=","venue":"arXiv (Cornell University)","work_id":"243fa248-67ca-40ce-89c9-731c697bc4b3","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:29f055aaaae05003524d0bdd27ba5b983da6521c4a37613a4986d2023833753d","observation_id":"30c866d9-141b-4470-a276-ba5f721bdf87","resolution":{"observed_at":"2026-07-09T15:06:18.088269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16014","last_updated":"2024-04-30T17:54:04Z","snapshot_observed_at":"2026-08-02T10:59:21.418230Z","submitted_at":"2024-04-24T17:47:22Z","title":"Improving Dictionary Learning with Gated Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":"2404.16014","doi":"10.48550/arxiv.2404.16014","metadata_source":"pith","pith_arxiv_id":"2404.16014","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving Dictionary Learning with Gated Sparse Autoencoders","venue":"cs.LG","work_id":"3f6ee9ca-2e43-4536-a753-1e8c881c9229","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2404.16014","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:19ef3e0e9dc56414c45914b8de5abce95f257cf54f90eaf478cb8a939d07cdc2","observation_id":"8db91b84-83df-4784-a41f-ca281954b333","resolution":{"observed_at":"2026-07-09T15:06:18.019153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":"2406.04093","doi":"10.48550/arxiv.2406.04093","metadata_source":"pith","pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling and evaluating sparse autoencoders","venue":"cs.LG","work_id":"f3faddeb-36ed-42bc-a7c9-9e764dc9b368","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:8ad38ae42d8d07883fb525514a5d8f6861e521dc7793f0441c9df64796cd104b","observation_id":"235e1987-b44e-4e83-b0fb-de12c9d54521","resolution":{"observed_at":"2026-07-09T15:06:18.086817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06410","last_updated":"2024-12-09T11:39:00Z","snapshot_observed_at":"2026-08-01T21:49:25.316353Z","submitted_at":"2024-12-09T11:39:00Z","title":"BatchTopK Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":"2412.06410","doi":"10.48550/arxiv.2412.06410","metadata_source":"pith","pith_arxiv_id":"2412.06410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Batchtopk sparse autoencoders","venue":"cs.LG","work_id":"812bea0e-6edc-46bc-8213-fbf0ebf4b662","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2412.06410","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:540621cae22dbbe4f9a0ec7fc07d8584ac2bdd7be795e68dabac7b27597a3889","observation_id":"e8fddea9-8b35-4737-a383-eada0b901c16","resolution":{"observed_at":"2026-07-09T15:06:18.048729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.16570","doi":"10.48550/arxiv.2502.16570","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audenaert, K","venue":"arXiv (Cornell University)","work_id":"a43db906-defa-46a6-85bd-8335a6e5b9dd","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:aa7f70120216eebb9ccf47133483121972bb80ca35b87989ce0a88c059afe4ce","observation_id":"077a9b76-8336-44f2-9a37-1fc4b87c3bad","resolution":{"observed_at":"2026-07-09T15:06:18.028400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:19.002467Z","title":"Activation oracles: Training and evaluating llms as general-purpose activation explainers,","venue":null,"work_id":"8427090a-59b4-4c80-93fb-98d5b4393d2d","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:690c14038ebda5994cff971bbfc6896f050392799213968658f271275ffc3884","observation_id":"53703399-7927-475c-99bc-6b63e14c41e3","resolution":{"observed_at":"2026-07-09T15:06:19.003836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19183","last_updated":"2026-06-06T19:42:09Z","snapshot_observed_at":"2026-08-10T05:48:58.551135Z","submitted_at":"2026-03-19T17:42:05Z","title":"Sparse Autoencoders Reveal Interpretable and Steerable Features in VLA Models","version":2},"cited_work":{"arxiv_id":"2603.19183","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.19183","snapshot_observed_at":"2026-07-09T15:06:18.055482Z","title":"Sparse autoencoders reveal interpretable and steerable features in vla models","venue":"cs.RO","work_id":"4f40c813-6380-4054-8023-5f982495bd90","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2603.19183","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:f8170244d2dd98cad0a14ef7860ea01a94a0ae581811d799ed117ccc364e3cb3","observation_id":"1fd9a259-9392-4d76-a039-b745e8456d07","resolution":{"observed_at":"2026-07-09T15:06:18.056758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:19.004346Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models,","venue":null,"work_id":"87b7c453-6b3f-42b3-8efd-ab2a860c114d","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:e03f4937c0907520e186efc57fd6eb88004b9dc93dddb5d5b1147848588db51c","observation_id":"142f55d9-02e5-485e-a854-5890cf86d591","resolution":{"observed_at":"2026-07-09T15:06:19.006000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":"2403.19647","doi":"10.48550/arxiv.2403.19647","metadata_source":"pith","pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","venue":"cs.LG","work_id":"fb24e7e7-f336-4706-bc2d-62d656b28d74","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:3dc9aebda88e3fbd3273b15acaae8b7720b1ff67359c5ae6626ab488d19f0d31","observation_id":"592881ed-6b90-4ad2-ada9-af85ad615057","resolution":{"observed_at":"2026-07-09T15:06:17.997850Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:19.006582Z","title":"Evaluating explanation faithfulness in toy models,","venue":null,"work_id":"f1d0da63-ba6d-4f18-8140-ea352aca7b99","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:243e1bd21577084e8da4b8c3b819d8acada1ee9e772018c04d25a82033c15f53","observation_id":"c53ab872-313b-4f33-803c-bd9ff9ba7b49","resolution":{"observed_at":"2026-07-09T15:06:19.007862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11944","last_updated":"2024-11-06T22:37:30Z","snapshot_observed_at":"2026-08-10T16:34:30.402009Z","submitted_at":"2024-06-17T17:49:00Z","title":"Transcoders Find Interpretable LLM Feature Circuits","version":2},"cited_work":{"arxiv_id":"2406.11944","doi":"10.48550/arxiv.2406.11944","metadata_source":"pith","pith_arxiv_id":"2406.11944","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transcoders Find Interpretable LLM Feature Circuits","venue":"cs.LG","work_id":"36a1b61a-64ca-4af5-b0c6-52d525c24c80","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2406.11944","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:1ee7c66daf100dfb19c7720eeb5e68e05fc385d46f6a52ff7814133267825b1d","observation_id":"70c3af1d-2434-48eb-bc8a-6922bae50f2c","resolution":{"observed_at":"2026-07-09T15:06:18.057814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14936","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.077400Z","title":"Circuit insights: Towards inter- pretability beyond activations,","venue":null,"work_id":"b7d40dad-0142-4da3-88a8-8f09ee2f3136","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:b587320f59fad7f54c8586908fcf94acf627373592e02a34b6846d26655110cf","observation_id":"7e639826-0ce8-46bb-8c5a-55e0af2be5ec","resolution":{"observed_at":"2026-07-09T15:06:18.079064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.06608","doi":"10.48550/arxiv.2509.06608","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Viacheslav Sinii, Nikita Balagansky, Gleb Gerasimov, Daniil Laptev, Yaroslav Aksenov, Vadim Kurochkin, Alexey Gorbatovski, Boris Shaposhnikov, and Daniil Gavrilov","venue":"Open MIND","work_id":"dfed1ee7-5210-4d1a-85db-85b68fc97cf6","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:8cd9a38466ca618886f3333510838f059bf589d92a8c4516f8d1023151f4f84f","observation_id":"9b6031d9-f633-4147-83a1-b963273e6dff","resolution":{"observed_at":"2026-07-09T15:06:18.034965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.998165Z","title":"Model whisper: Steering vectors unlock large language models’ potential in test- time,","venue":null,"work_id":"3808260b-cd54-4760-85e8-477efb68a160","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:9564bccc6e1255f8f1c6805af8efebedb61463902c95d7347eb941a017e135cb","observation_id":"b257c578-4d8b-4dab-ac70-1eeae03666d3","resolution":{"observed_at":"2026-07-09T15:06:18.999781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16385","last_updated":"2025-02-22T23:56:30Z","snapshot_observed_at":"2026-08-07T17:55:53.592565Z","submitted_at":"2025-02-22T23:56:30Z","title":"Toward a Flexible Framework for Linear Representation Hypothesis Using Maximum Likelihood Estimation","version":1},"cited_work":{"arxiv_id":"2502.16385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.16385","snapshot_observed_at":"2026-07-09T15:06:17.999095Z","title":"Toward a Flexible Framework for Linear Representation Hypothesis Using Maximum Likelihood Estimation","venue":"cs.LG","work_id":"f4a634c0-6c5a-4744-90aa-f2ddd034ef89","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2502.16385","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:81212a44ac2dad5b5b4cbbb944cc2893316f5c84a59c9feb06a67a9c435a9cd6","observation_id":"8d6fc394-2615-41fe-afdb-9dc0ff8bb575","resolution":{"observed_at":"2026-07-09T15:06:18.000935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17601","last_updated":"2025-02-24T19:36:26Z","snapshot_observed_at":"2026-08-07T20:51:45.102479Z","submitted_at":"2025-02-24T19:36:26Z","title":"Representation Engineering for Large-Language Models: Survey and Research Challenges","version":1},"cited_work":{"arxiv_id":"2502.17601","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17601","snapshot_observed_at":"2026-07-09T15:06:18.060577Z","title":"arXiv preprint arXiv:2502.17601 , year=","venue":"cs.AI","work_id":"51fdfe62-1d7e-42dd-8095-814177afc1f4","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2502.17601","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:22e01e112d5f726dac8b457a4365accdca93af9992f6c6b86771d3ec5ca7073d","observation_id":"6c51d80d-f7d2-4adf-b113-02c320bf61b9","resolution":{"observed_at":"2026-07-09T15:06:18.061917Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":"2308.10248","doi":"10.18653/v1/2024.findings-acl.611","metadata_source":"pith","pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Language Models With Activation Engineering","venue":"cs.CL","work_id":"d525fe06-5560-4e97-86fc-7a0e551f5b17","year":2023},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:9ebc4cfdb6f66d054e5ce1e8661ded2db7af46ceba41728b0a282f0e7038e48a","observation_id":"9306888a-afae-4172-baed-357ce49becde","resolution":{"observed_at":"2026-07-09T15:06:18.064625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":"2312.06681","doi":"10.48550/arxiv.2312.06681","metadata_source":"pith","pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Llama 2 via Contrastive Activation Addition","venue":"cs.CL","work_id":"3317feaa-e788-45fc-95aa-4ea20028b55b","year":2023},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:08eafe153b9dc387f51fa9c6c91c2127385d167c4d1fac444be1ca01e1d76111","observation_id":"798d7223-9156-4c23-aab9-b87ae5d1a9cc","resolution":{"observed_at":"2026-07-09T15:06:18.071191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-10T18:38:15.114463+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T18:38:15.114463+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:19.008651Z","title":"Emotion concepts and their function in a large language model,","venue":null,"work_id":"286d59b7-d6d7-4382-9ef6-18a89036ea1c","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:b60917c9e85f1665b1b8fb9aa0eb5e929d8caebbbd6bb26b06e83a2833817317","observation_id":"1d3be7df-a21f-4b83-8e1a-6bac0e8e64e8","resolution":{"observed_at":"2026-07-09T15:06:19.009978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09929","last_updated":"2025-04-02T13:20:40Z","snapshot_observed_at":"2026-08-10T19:28:48.617503Z","submitted_at":"2025-01-17T02:55:23Z","title":"Interpretable Steering of Large Language Models with Feature Guided Activation Additions","version":3},"cited_work":{"arxiv_id":"2501.09929","doi":"10.48550/arxiv.2501.09929","metadata_source":"pith","pith_arxiv_id":"2501.09929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretable steering of large language models with feature guided activation additions.arXiv preprint arXiv:2501.09929","venue":"cs.LG","work_id":"e00275a9-9edf-4d9b-897f-0eb81295be88","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2501.09929","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:749ff0a655d8c8cc66c2b26dc477c67e4f39107a8f8799e70b5497b72f6c9585","observation_id":"f33bc7f5-1f00-42d3-bfaf-b0c109102fe9","resolution":{"observed_at":"2026-07-09T15:06:18.052467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.058920Z","title":"Dspa: Dynamic sae steering for data-efficient preference alignment,","venue":null,"work_id":"e8cf6ac1-4857-45a5-b2d6-1d3ba1a11abf","year":2026},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:319ba497a3e89d883e9d69afcf4307972b202a0f78854e0fefb15c40f77f0378","observation_id":"7e71e554-704c-43c3-ad31-04c5b6c3f812","resolution":{"observed_at":"2026-07-09T15:06:18.060488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.989531Z","title":"Fold-se: An efficient rule-based machine learning algorithm with scalable explainability,","venue":null,"work_id":"c90d7c65-d372-4a7c-b983-b04f6957685f","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:199170fad9a82b3e5e8bfe23edd11abf3d775d4f5d1dce421ce82832174dedd6","observation_id":"600aa25f-de6e-493b-b00a-67fc8b8c2852","resolution":{"observed_at":"2026-07-09T15:06:18.991860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07912","last_updated":"2023-01-10T05:37:27Z","snapshot_observed_at":"2026-08-10T20:32:58.588459Z","submitted_at":"2022-08-16T19:15:11Z","title":"FOLD-SE: An Efficient Rule-based Machine Learning Algorithm with Scalable Explainability","version":2},"cited_work":{"arxiv_id":"2208.07912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.07912","snapshot_observed_at":"2026-07-09T15:06:18.068217Z","title":"FOLD-SE: An Efficient Rule-based Machine Learning Algorithm with Scalable Explainability","venue":"cs.LG","work_id":"064de387-3c90-4f79-8cf4-2a1a786a4720","year":2022},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2208.07912","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:95bd11f79128eba9416edb74b16dafd33e2e5ffb3cad107ca54dea93e78f87bc","observation_id":"1b470a6b-a012-4abd-b922-09b8af20cea8","resolution":{"observed_at":"2026-07-09T15:06:18.069562Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.995547Z","title":"Nesyfold: Neurosym- bolic framework for interpretable image classification,","venue":null,"work_id":"d743035a-2f21-4984-94cb-c72408883d63","year":null},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:dec1aae3a9788014e4fedf02734f51670e17d0fa421a5fdac67e6318a915c545","observation_id":"a0950a2e-d21d-4f96-88f7-4358eef3d4cf","resolution":{"observed_at":"2026-07-09T15:06:18.997440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12667","last_updated":"2023-08-20T21:19:13Z","snapshot_observed_at":"2026-08-10T03:46:10.693606Z","submitted_at":"2023-01-30T05:08:05Z","title":"NeSyFOLD: Neurosymbolic Framework for Interpretable Image Classification","version":3},"cited_work":{"arxiv_id":"2301.12667","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12667","snapshot_observed_at":"2026-07-09T15:06:18.072440Z","title":"NeSyFOLD: Neurosymbolic Framework for Interpretable Image Classification","venue":"cs.LG","work_id":"7c52154b-33c9-4a77-92af-2d28dc1f5c08","year":2023},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2301.12667","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:7b0ce6b40a92b61d1f143417f19d4b93593b4ab486a1ecea5e058e14016ec795","observation_id":"72c5a146-39e8-49b7-bed7-8fd5ec05e676","resolution":{"observed_at":"2026-07-09T15:06:18.073728Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/s1471068425100318","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Theory and Practice of Logic Programming 25(4), 722–738 (2025)","venue":"Theory and Practice of Logic Programming","work_id":"b429d158-a4fa-49b1-bf41-5919ee1e6225","year":2025},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:11b0bc198630fc82ddfbb83ec8d4dd4e66d47383ca076f5c575944c794fb3175","observation_id":"706718ba-0b62-490b-8cd4-66c287373325","resolution":{"observed_at":"2026-07-09T15:06:17.896973Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.985029Z","title":"Logic-lm: Empowering large language models with symbolic solvers for faithful logical reasoning,","venue":null,"work_id":"3d6fb0c8-67c2-43ad-9959-fcfdac915b94","year":2023},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:63c1161a1a6ae2c875fb545c74ae4187870084482e71ea6387fdea6395915bf1","observation_id":"43abf867-60dd-4f7a-b873-3fdf51929ebd","resolution":{"observed_at":"2026-07-09T15:06:18.988371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:18.981210Z","title":"Llms can’t plan, but can help planning in llm-modulo frame- works,","venue":null,"work_id":"ceaa7691-ebb4-41e2-b44f-3b4a3087ee24","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:69e26fc7dc98262abad0a510a5c2702da3d415ad858b9a9a7126ef6b3396445d","observation_id":"3c352f67-2928-490d-8700-39183cbbbcdb","resolution":{"observed_at":"2026-07-09T15:06:18.984081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08366","last_updated":"2024-05-20T17:46:14Z","snapshot_observed_at":"2026-08-09T21:06:45.027308Z","submitted_at":"2024-05-14T07:07:13Z","title":"Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control","version":3},"cited_work":{"arxiv_id":"2405.08366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.08366","snapshot_observed_at":"2026-07-09T15:06:18.018501Z","title":"Towards principled evaluations of sparse autoencoders for interpretability and control","venue":"cs.LG","work_id":"62c3a1ce-4200-4d7d-b731-7e5def3e234e","year":2024},"citing_paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-09T14:58:58.363330Z"},"links":{"cited_paper":"/paper/2405.08366","citing_paper":"/paper/2607.07316"},"observation_digest":"sha256:b0900e4312594ddccd54a1a69b073bc92735733b5164e426fe06ef515906d7ac","observation_id":"0350b262-9dc1-4971-a7fb-b351476dfebc","resolution":{"observed_at":"2026-07-09T15:06:18.019911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07316","last_updated":"2026-07-08T12:04:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T03:56:05.019257Z","submitted_at":"2026-07-08T12:04:38Z","title":"Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":2,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":21},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.07316."}