{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:SNIRXONKU5MWBY7MKFWKFHZ534","short_pith_number":"pith:SNIRXONK","schema_version":"1.0","canonical_sha256":"93511bb9aaa75960e3ec516ca29f3ddf101ff09237ce39df0b43ed964caada4c","source":{"kind":"arxiv","id":"2310.17230","version":1},"attestation_state":"computed","paper":{"title":"Codebook Features: Sparse and Discrete Interpretability for Neural Networks","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Alex Tamkin, Mohammad Taufeeque, Noah D. Goodman","submitted_at":"2023-10-26T08:28:48Z","abstract_excerpt":"Understanding neural networks is challenging in part because of the dense, continuous nature of their hidden states. We explore whether we can train neural networks to have hidden states that are sparse, discrete, and more interpretable by quantizing their continuous features into what we call codebook features. Codebook features are produced by finetuning neural networks with vector quantization bottlenecks at each layer, producing a network whose hidden features are the sum of a small number of discrete vector codes chosen from a larger codebook. Surprisingly, we find that neural networks ca"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.17230","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-10-26T08:28:48Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"0bdb9a2e15a5838c8719c67bd4177dc837e76fb2433af6f278a7ea1d4d1e0a16","abstract_canon_sha256":"485143b6aee0a5ae41e80ed8dd9346ab17df7a9968436abc34f9a8e85e8e53f3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:05:21.772411Z","signature_b64":"IjuLwVPO+4Ss0zwK+HBdDhiho5hhdJMBqjr/kZEIni/Sl1N126wlD41a8HTC2ANqFYpz4grl1L04/wBEJQaOAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"93511bb9aaa75960e3ec516ca29f3ddf101ff09237ce39df0b43ed964caada4c","last_reissued_at":"2026-07-05T07:05:21.771872Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:05:21.771872Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Codebook Features: Sparse and Discrete Interpretability for Neural Networks","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Alex Tamkin, Mohammad Taufeeque, Noah D. Goodman","submitted_at":"2023-10-26T08:28:48Z","abstract_excerpt":"Understanding neural networks is challenging in part because of the dense, continuous nature of their hidden states. We explore whether we can train neural networks to have hidden states that are sparse, discrete, and more interpretable by quantizing their continuous features into what we call codebook features. Codebook features are produced by finetuning neural networks with vector quantization bottlenecks at each layer, producing a network whose hidden features are the sum of a small number of discrete vector codes chosen from a larger codebook. Surprisingly, we find that neural networks ca"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.17230","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.17230/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.17230","created_at":"2026-07-05T07:05:21.771925+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.17230v1","created_at":"2026-07-05T07:05:21.771925+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.17230","created_at":"2026-07-05T07:05:21.771925+00:00"},{"alias_kind":"pith_short_12","alias_value":"SNIRXONKU5MW","created_at":"2026-07-05T07:05:21.771925+00:00"},{"alias_kind":"pith_short_16","alias_value":"SNIRXONKU5MWBY7M","created_at":"2026-07-05T07:05:21.771925+00:00"},{"alias_kind":"pith_short_8","alias_value":"SNIRXONK","created_at":"2026-07-05T07:05:21.771925+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.31845","citing_title":"Explicit Fuzzy Logic in the Feed-Forward Layer: Self-Forgetting Quantifiers Discover Legible Grammatical-Licensing Detectors","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29358","citing_title":"Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet","ref_index":68,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534","json":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534.json","graph_json":"https://pith.science/api/pith-number/SNIRXONKU5MWBY7MKFWKFHZ534/graph.json","events_json":"https://pith.science/api/pith-number/SNIRXONKU5MWBY7MKFWKFHZ534/events.json","paper":"https://pith.science/paper/SNIRXONK"},"agent_actions":{"view_html":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534","download_json":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534.json","view_paper":"https://pith.science/paper/SNIRXONK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.17230&json=true","fetch_graph":"https://pith.science/api/pith-number/SNIRXONKU5MWBY7MKFWKFHZ534/graph.json","fetch_events":"https://pith.science/api/pith-number/SNIRXONKU5MWBY7MKFWKFHZ534/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534/action/storage_attestation","attest_author":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534/action/author_attestation","sign_citation":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534/action/citation_signature","submit_replication":"https://pith.science/pith/SNIRXONKU5MWBY7MKFWKFHZ534/action/replication_record"}},"created_at":"2026-07-05T07:05:21.771925+00:00","updated_at":"2026-07-05T07:05:21.771925+00:00"}