{"as_of":"2026-08-09T11:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d1b282a6d086c98b0627e35736620252af84c9597bce4d74a7cc74d205830e1","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:43:52.365784Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.12879/citation-record","integrity":"/paper/2601.12879/integrity","json":"/paper/2601.12879/citation-record.json","paper":"/paper/2601.12879"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.125275Z","title":"On the biology of a large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.125275Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:81b498844babf28008fd606c09d37266c4ebfb0ee558462ba15e04e5eddc1cc6","observation_id":"d0cc2fb5-b57f-4b0a-81a7-667964faf50b","resolution":{"observed_at":"2026-08-03T09:43:49.125275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.235460Z","title":"Neuron-level circuits: Pruning MLPs to interpret their weights,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.235460Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:390abe59604e790088acc634d91f14a874df9089a5c6bf73df1b0518d34cbac4","observation_id":"391cb797-e7a6-493c-be4d-39c5b88a5fe3","resolution":{"observed_at":"2026-08-03T09:43:49.235460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.304775Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.304775Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:7bc59368515a06acf0e54cc4aeb915a612be3ac249b9d5965d80d80c606c8dad","observation_id":"d7548e98-44fb-43b2-a42c-a944b2ad7626","resolution":{"observed_at":"2026-08-03T09:43:49.304775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.398597Z","title":"Towards automated circuit discovery for mechanistic interpretability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.398597Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:0b00fcda4b5882a6ffeabd4492118442b7c7fbbe1649a6846d78bc70d4ac1d7e","observation_id":"802fd163-2658-46b5-8e27-14945fd23d91","resolution":{"observed_at":"2026-08-03T09:43:49.398597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.534573Z","title":"Sparse autoencoders find highly interpretable features in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.534573Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:a227fc969f8be5c3a370ca48d60ef954a31057251f2beb3db801c6818ee5e27f","observation_id":"faa2c21d-e8bc-478d-858e-625c118b0fa3","resolution":{"observed_at":"2026-08-03T09:43:49.534573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.641496Z","title":"A mathematical framework for transformer circuits,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.641496Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:936f9c7a75ba91aa680fa9ae23c9ccf6aab151f7b013d8b8d94d60158897879c","observation_id":"fd28ad7c-102e-440f-a88c-684c6b7f23d3","resolution":{"observed_at":"2026-08-03T09:43:49.641496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-03T09:43:49.711493Z","title":"Scaling and evaluating sparse autoencoders,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.711493Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:b71cc183c4226d9e97aeec0d16d5f86954065763e92bb79cf4a337434067261d","observation_id":"835c8bab-0aa1-4283-ace1-20176783805a","resolution":{"observed_at":"2026-08-03T09:43:49.711493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.812527Z","title":"Weight-sparse transformers enable circuit- level interpretability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.812527Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:8ee50427dd0fa4b9910a400691b21d88586359c9bd1e2bc8813c00fd7c745184","observation_id":"f7923efe-a802-45c1-8707-cda8d1dfea50","resolution":{"observed_at":"2026-08-03T09:43:49.812527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.923000Z","title":"How does GPT-2 compute greater- than? Interpreting mathematical abilities in a pre-trained language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.923000Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:a3b932047dc0c3ccf685957bd0398a06089ab9745a3f2d4f6081954be8393523","observation_id":"31ae78bf-96ed-4ae4-9325-64323a8dc453","resolution":{"observed_at":"2026-08-03T09:43:49.923000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-03T09:43:50.035165Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.035165Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:8fae57dd265acb604f8180a3ee40eb3e0eb4dbd4414eb74950a044438f4d7445","observation_id":"ab53a23b-8503-44ad-9294-6d414d599586","resolution":{"observed_at":"2026-08-03T09:43:50.035165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.137289Z","title":"Locating and editing factual associations in GPT,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.137289Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:f800c8e714d656a78ba6ecef548c3a7fc460de718da2c7eb780669a1546fcbdc","observation_id":"4b0637bd-db8f-4c28-beb2-1e266751d905","resolution":{"observed_at":"2026-08-03T09:43:50.137289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05110","last_updated":"2024-02-07T18:59:12Z","snapshot_observed_at":"2026-07-06T17:26:59.606509Z","submitted_at":"2024-02-07T18:59:12Z","title":"Opening the AI black box: program synthesis via mechanistic interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05110","snapshot_observed_at":"2026-08-03T09:43:50.257577Z","title":"Opening the AI black box: Program synthesis via mechanistic interpretability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.257577Z"},"links":{"cited_paper":"/paper/2402.05110","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:9139a3361246504cae145a741c79e67157b1a93ecdb03a7d5046c0dcdc4ca23e","observation_id":"dcc84977-3b77-42ba-8fc9-d8c2854ad4db","resolution":{"observed_at":"2026-08-03T09:43:50.257577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.367945Z","title":"Progress measures for grokking via mechanistic interpretability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.367945Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:add1ff871bf4dcded5b41f1f4bd2a4729c202615479d495c2b42233aff6dd397","observation_id":"6266d2e6-4d8b-4f1a-a207-59b4d869d5d4","resolution":{"observed_at":"2026-08-03T09:43:50.367945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.503592Z","title":"Zoom in: An introduction to circuits,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.503592Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:2b83a60526cc278028a90a31526fd61a2fd2c58f9f26ed9eaa51433c981812ea","observation_id":"06044f44-1c1d-493f-8975-e7a5cd4fb4df","resolution":{"observed_at":"2026-08-03T09:43:50.503592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.599223Z","title":"In-context learning and induction heads,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.599223Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:e6b3b38f9628157808e9c691db67a9bbca5eacbf9a7f6d48899560b59ed0c249","observation_id":"4abdb7b7-c840-403d-b933-8e9640cbb065","resolution":{"observed_at":"2026-08-03T09:43:50.599223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.694901Z","title":"Interpretability in weight-sparse language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.694901Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:6e518e4b4e68ebd17df7cca3e24346cf131dd8d4ee9b7d38804e2d588ea5729c","observation_id":"c0de4904-b85e-414f-b009-f53bfdfae9a4","resolution":{"observed_at":"2026-08-03T09:43:50.694901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.793355Z","title":"WinoGrande: An adversarial Winograd schema challenge at scale,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.793355Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:7c29a40f4429d39c57125384bca2436a4b8cc9571c7176c8eab307982db5b100","observation_id":"3c5c2b99-3f9d-4601-8375-34f7b0095473","resolution":{"observed_at":"2026-08-03T09:43:50.793355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.857300Z","title":"Axiomatic attribution for deep networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.857300Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:0809b2f06b6bee8e698e6c3c047f3f0805b69103ac271fe5dbacc37f178dbfc5","observation_id":"6a87aa4f-61bd-4a52-bd04-0984d6918f92","resolution":{"observed_at":"2026-08-03T09:43:50.857300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.918324Z","title":"Graph attention networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.918324Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:1f1ee561dd14d5c411bc20fdaa1196f01301a605284bc6258b5440a662075342","observation_id":"77943da8-d398-4488-a65e-a657a04e3cff","resolution":{"observed_at":"2026-08-03T09:43:50.918324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.014469Z","title":"A tutorial on spectral clustering,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.014469Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:6fd28e9417c4dfdba984e5f8c9f4899bcea75724bd65eb33430e63adc2f0e05e","observation_id":"bb9c5879-4246-498a-9555-3f30ae24c950","resolution":{"observed_at":"2026-08-03T09:43:51.014469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.120300Z","title":"Interpretability in the wild: A circuit for indirect object identification in GPT-2 small,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.120300Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:bcf84c27c84ba1c66515bcd3f9d77136d2be4ad5e6114ff59d23e43443cee72f","observation_id":"3db8098d-c348-4ddc-ba18-173046f9eed1","resolution":{"observed_at":"2026-08-03T09:43:51.120300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.223515Z","title":"HellaSwag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.223515Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:830e8e7742ca52ee975bd754b6f9cb100576bcdcbb92eef385bd58388b05f727","observation_id":"3309cf29-2ca0-489c-a845-785cf7340b0f","resolution":{"observed_at":"2026-08-03T09:43:51.223515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.305333Z","title":"Defining and quantifying the emergence of sparse concepts in DNNs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.305333Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:7fbcbab0843e0defa1366ab3f246771d53332fc1e6ad293523f0ebf28494fba6","observation_id":"1ab5c987-1b91-4bbf-a132-c016e5f8b48b","resolution":{"observed_at":"2026-08-03T09:43:51.305333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13091","last_updated":"2024-09-13T09:19:14Z","snapshot_observed_at":"2026-07-06T14:55:45.711180Z","submitted_at":"2023-02-25T14:44:40Z","title":"Explaining Generalization Power of a DNN Using Interactive Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13091","snapshot_observed_at":"2026-08-03T09:43:51.389495Z","title":"Explaining generalization power of a DNN using interactive concepts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.389495Z"},"links":{"cited_paper":"/paper/2302.13091","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:b6451fb75b7d0abb5d147cee368e405ac6cb08942ae07b1cedc5deba23063dcc","observation_id":"14567aa2-d0be-4117-9d97-a26f66e3f28e","resolution":{"observed_at":"2026-08-03T09:43:51.389495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01939","last_updated":"2024-09-13T09:22:38Z","snapshot_observed_at":"2026-07-06T15:22:40.401971Z","submitted_at":"2023-05-03T07:32:28Z","title":"Where We Have Arrived in Proving the Emergence of Sparse Symbolic Concepts in AI Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01939","snapshot_observed_at":"2026-08-03T09:43:51.444060Z","title":"Where we have arrived in proving the emergence of sparse symbolic concepts in AI models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.444060Z"},"links":{"cited_paper":"/paper/2305.01939","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:537e6e515efae9b5204cf437c351d1d5275056bccef1b53b3edb0be5fe3cec9c","observation_id":"108f8857-6bb4-4ef9-a159-34eaad577db0","resolution":{"observed_at":"2026-08-03T09:43:51.444060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.571509Z","title":"Discovering transformer circuits via a hybrid attribution and pruning framework,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.571509Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:38fd5043cd53758e2e19c09598f59f5bd67c3d3002b6fa80ac9e7af045dc5693","observation_id":"7661e431-78d3-4658-89f7-ff4c76786339","resolution":{"observed_at":"2026-08-03T09:43:51.571509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16778","last_updated":"2025-04-02T15:50:36Z","snapshot_observed_at":"2026-07-06T18:36:07.983955Z","submitted_at":"2024-06-24T16:40:54Z","title":"Finding Transformer Circuits with Edge Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16778","snapshot_observed_at":"2026-08-03T09:43:51.664374Z","title":"Finding transformer circuits with edge pruning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.664374Z"},"links":{"cited_paper":"/paper/2406.16778","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:d62a6a62b494c090fde72fa6933e99091ea21ba0cd07a1fd54147444b87d5099","observation_id":"32c0e022-4ff3-4b37-ab01-bc282130c0b7","resolution":{"observed_at":"2026-08-03T09:43:51.664374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10928","last_updated":"2024-05-20T16:34:37Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:27:19Z","title":"The Local Interaction Basis: Identifying Computationally-Relevant and Sparsely Interacting Features in Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10928","snapshot_observed_at":"2026-08-03T09:43:51.759455Z","title":"The local interaction basis: Identifying computationally-relevant and sparsely interacting features in neural networks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.759455Z"},"links":{"cited_paper":"/paper/2405.10928","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:f45f895d2f3b80244f222ed3af7272eb45dc1f9d2a78f9728e805bb39b320c9a","observation_id":"41f662ed-8cda-45f9-8513-d84adc21fdd9","resolution":{"observed_at":"2026-08-03T09:43:51.759455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.848811Z","title":"Functional faithfulness in the wild: Circuit discovery with differentiable computation graph pruning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.848811Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:8568fa9a6f61831db5dcd7f07deb05714ed42e9b8dbe13d161ad95e715947eb1","observation_id":"e6ba8fc2-78e3-4460-b558-56d18494edc5","resolution":{"observed_at":"2026-08-03T09:43:51.848811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13868","last_updated":"2024-07-21T11:42:32Z","snapshot_observed_at":"2026-08-02T09:03:28.447459Z","submitted_at":"2024-05-22T17:50:04Z","title":"Automatically Identifying Local and Global Circuits with Linear Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13868","snapshot_observed_at":"2026-08-03T09:43:51.976205Z","title":"Automatically identifying local and global circuits with linear computation graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.976205Z"},"links":{"cited_paper":"/paper/2405.13868","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:c5d45a7c13d6377bdcf6c0274cd608d769799c399c6d746a33015a371d1fe564","observation_id":"5654fa34-3495-42a0-9255-8f73d36c51b5","resolution":{"observed_at":"2026-08-03T09:43:51.976205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18147","last_updated":"2025-06-06T11:10:03Z","snapshot_observed_at":"2026-08-09T11:08:51.703405Z","submitted_at":"2025-02-25T12:21:45Z","title":"Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18147","snapshot_observed_at":"2026-08-03T09:43:52.064760Z","title":"Jacobian sparse autoen- coders: Sparsify computations, not just activations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.064760Z"},"links":{"cited_paper":"/paper/2502.18147","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:f4626056653f07fe1387be0fd8bee855995cd91883db306c4634708bb8bd537f","observation_id":"869198f6-eea5-4563-9323-7ec30859625e","resolution":{"observed_at":"2026-08-03T09:43:52.064760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:52.156854Z","title":"Weight-sparse transformers have interpretable circuits,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.156854Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:90520fbfba1091672c8e296d5988d3b2db02d6d954b217160229f0b62225a958","observation_id":"0d05f45f-e122-4ca0-b692-394ffce71a70","resolution":{"observed_at":"2026-08-03T09:43:52.156854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:52.248658Z","title":"Language models can explain neurons in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.248658Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:89a05821bd962d74aca307632626279f2b12e3b74f057d4fda469b6d9f0df436","observation_id":"320a465d-0560-4a4a-8d81-b6836593b1a3","resolution":{"observed_at":"2026-08-03T09:43:52.248658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:52.314120Z","title":"Scaling monosemanticity: Extracting interpretable features from Claude 3 Sonnet,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.314120Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:1bf94cbda781d1e826f93888ddd002f98668204f5c27e07cca8741ceaa5c2e2f","observation_id":"d3f8a902-d44a-4d03-aac9-0cbb97c3e0c1","resolution":{"observed_at":"2026-08-03T09:43:52.314120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09458","last_updated":"2023-07-24T08:32:40Z","snapshot_observed_at":"2026-07-06T15:55:28.974661Z","submitted_at":"2023-07-18T17:39:04Z","title":"Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09458","snapshot_observed_at":"2026-08-03T09:43:52.365784Z","title":"Does circuit analysis interpretability scale? Evi- dence from multiple choice capabilities in Chinchilla,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.365784Z"},"links":{"cited_paper":"/paper/2307.09458","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:b8dabe126a55ee380d9b10002acaec773c53972d8a7c41166900802be1400df7","observation_id":"099071a3-e247-46cf-b4f2-f173e10818af","resolution":{"observed_at":"2026-08-03T09:43:52.365784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:09:32.019326Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2601.12879."}