{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:CZ2CTKHA4AJO4ZCGDDOPFR6KGU","short_pith_number":"pith:CZ2CTKHA","schema_version":"1.0","canonical_sha256":"167429a8e0e012ee644618dcf2c7ca351cec43a0cc1926c6c52f17fb94dfe2e8","source":{"kind":"arxiv","id":"2305.08809","version":3},"attestation_state":"computed","paper":{"title":"Interpretability at Scale: Identifying Causal Mechanisms in Alpaca","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Atticus Geiger, Christopher Potts, Noah D. Goodman, Thomas Icard, Zhengxuan Wu","submitted_at":"2023-05-15T17:15:40Z","abstract_excerpt":"Obtaining human-interpretable explanations of large, general-purpose language models is an urgent goal for AI safety. However, it is just as important that our interpretability methods are faithful to the causal dynamics underlying model behavior and able to robustly generalize to unseen inputs. Distributed Alignment Search (DAS) is a powerful gradient descent method grounded in a theory of causal abstraction that has uncovered perfect alignments between interpretable symbolic algorithms and small deep learning models fine-tuned for specific tasks. In the present paper, we scale DAS significan"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.08809","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-05-15T17:15:40Z","cross_cats_sorted":[],"title_canon_sha256":"e7d5d08f1582408d6cf9729682822355f74a0b19617d61ba4ebef132d849ff0c","abstract_canon_sha256":"78c6322aeffe0cb8079a2df36ac63f068103ae60c8a50642282e556af74e6dcb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:42:17.237098Z","signature_b64":"MrgfSTvSjzJm+ZRyUr/FeZlCg1r8G1T5F9+b8eoKzvskI8FiyMX8j5a+DhlW6ADaRcfkPMgrx/Ljknmtx7ZMCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"167429a8e0e012ee644618dcf2c7ca351cec43a0cc1926c6c52f17fb94dfe2e8","last_reissued_at":"2026-07-05T07:42:17.236520Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:42:17.236520Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Interpretability at Scale: Identifying Causal Mechanisms in Alpaca","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Atticus Geiger, Christopher Potts, Noah D. Goodman, Thomas Icard, Zhengxuan Wu","submitted_at":"2023-05-15T17:15:40Z","abstract_excerpt":"Obtaining human-interpretable explanations of large, general-purpose language models is an urgent goal for AI safety. However, it is just as important that our interpretability methods are faithful to the causal dynamics underlying model behavior and able to robustly generalize to unseen inputs. Distributed Alignment Search (DAS) is a powerful gradient descent method grounded in a theory of causal abstraction that has uncovered perfect alignments between interpretable symbolic algorithms and small deep learning models fine-tuned for specific tasks. In the present paper, we scale DAS significan"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.08809","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.08809/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.08809","created_at":"2026-07-05T07:42:17.236588+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.08809v3","created_at":"2026-07-05T07:42:17.236588+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.08809","created_at":"2026-07-05T07:42:17.236588+00:00"},{"alias_kind":"pith_short_12","alias_value":"CZ2CTKHA4AJO","created_at":"2026-07-05T07:42:17.236588+00:00"},{"alias_kind":"pith_short_16","alias_value":"CZ2CTKHA4AJO4ZCG","created_at":"2026-07-05T07:42:17.236588+00:00"},{"alias_kind":"pith_short_8","alias_value":"CZ2CTKHA","created_at":"2026-07-05T07:42:17.236588+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27981","citing_title":"ToxiREX: A Dataset on Toxic REasoning in ConteXt","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12809","citing_title":"Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces","ref_index":83,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06979","citing_title":"PLOT: Progressive Localization via Optimal Transport in Neural Causal Abstraction","ref_index":18,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU","json":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU.json","graph_json":"https://pith.science/api/pith-number/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/graph.json","events_json":"https://pith.science/api/pith-number/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/events.json","paper":"https://pith.science/paper/CZ2CTKHA"},"agent_actions":{"view_html":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU","download_json":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU.json","view_paper":"https://pith.science/paper/CZ2CTKHA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.08809&json=true","fetch_graph":"https://pith.science/api/pith-number/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/graph.json","fetch_events":"https://pith.science/api/pith-number/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/action/storage_attestation","attest_author":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/action/author_attestation","sign_citation":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/action/citation_signature","submit_replication":"https://pith.science/pith/CZ2CTKHA4AJO4ZCGDDOPFR6KGU/action/replication_record"}},"created_at":"2026-07-05T07:42:17.236588+00:00","updated_at":"2026-07-05T07:42:17.236588+00:00"}