{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:EV5DV3TKMKTOAME3JTNEJXD6FE","short_pith_number":"pith:EV5DV3TK","schema_version":"1.0","canonical_sha256":"257a3aee6a62a6e0309b4cda44dc7e29054611e725f9b5e53bdc1922383b8bb4","source":{"kind":"arxiv","id":"2506.07691","version":1},"attestation_state":"computed","paper":{"title":"Training Superior Sparse Autoencoders for Instruct Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Hamid Alinejad-Rokny, Haoran Ye, Jiaming Li, Jimmy Chih-Hsien Peng, Lei Zhang, Min Yang, Xinyue Li, Yukun Chen","submitted_at":"2025-06-09T12:23:34Z","abstract_excerpt":"As large language models (LLMs) grow in scale and capability, understanding their internal mechanisms becomes increasingly critical. Sparse autoencoders (SAEs) have emerged as a key tool in mechanistic interpretability, enabling the extraction of human-interpretable features from LLMs. However, existing SAE training methods are primarily designed for base models, resulting in reduced reconstruction quality and interpretability when applied to instruct models. To bridge this gap, we propose $\\underline{\\textbf{F}}$inetuning-$\\underline{\\textbf{a}}$ligned $\\underline{\\textbf{S}}$equential $\\unde"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.07691","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-06-09T12:23:34Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"371f7f9c619d85db9ead363232cf87e6766dbcea1d870839f6f7c562cd5026be","abstract_canon_sha256":"0e26bf30b615b71ce5059676020ef78677fad9f66045ccf0fe17de63216e3dc3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:18:31.613885Z","signature_b64":"tACUQTn12irJMw9x1ZJry4VYM5TNc/YMqyCUsXqt4kQh1/jxhzqtO2hV0BhTLCaL/7sw3+3uDGwSE29AxKxPBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"257a3aee6a62a6e0309b4cda44dc7e29054611e725f9b5e53bdc1922383b8bb4","last_reissued_at":"2026-07-05T11:18:31.613266Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:18:31.613266Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Training Superior Sparse Autoencoders for Instruct Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Hamid Alinejad-Rokny, Haoran Ye, Jiaming Li, Jimmy Chih-Hsien Peng, Lei Zhang, Min Yang, Xinyue Li, Yukun Chen","submitted_at":"2025-06-09T12:23:34Z","abstract_excerpt":"As large language models (LLMs) grow in scale and capability, understanding their internal mechanisms becomes increasingly critical. Sparse autoencoders (SAEs) have emerged as a key tool in mechanistic interpretability, enabling the extraction of human-interpretable features from LLMs. However, existing SAE training methods are primarily designed for base models, resulting in reduced reconstruction quality and interpretability when applied to instruct models. To bridge this gap, we propose $\\underline{\\textbf{F}}$inetuning-$\\underline{\\textbf{a}}$ligned $\\underline{\\textbf{S}}$equential $\\unde"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.07691","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.07691/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.07691","created_at":"2026-07-05T11:18:31.613378+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.07691v1","created_at":"2026-07-05T11:18:31.613378+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.07691","created_at":"2026-07-05T11:18:31.613378+00:00"},{"alias_kind":"pith_short_12","alias_value":"EV5DV3TKMKTO","created_at":"2026-07-05T11:18:31.613378+00:00"},{"alias_kind":"pith_short_16","alias_value":"EV5DV3TKMKTOAME3","created_at":"2026-07-05T11:18:31.613378+00:00"},{"alias_kind":"pith_short_8","alias_value":"EV5DV3TK","created_at":"2026-07-05T11:18:31.613378+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2601.14004","citing_title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","ref_index":169,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE","json":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE.json","graph_json":"https://pith.science/api/pith-number/EV5DV3TKMKTOAME3JTNEJXD6FE/graph.json","events_json":"https://pith.science/api/pith-number/EV5DV3TKMKTOAME3JTNEJXD6FE/events.json","paper":"https://pith.science/paper/EV5DV3TK"},"agent_actions":{"view_html":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE","download_json":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE.json","view_paper":"https://pith.science/paper/EV5DV3TK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.07691&json=true","fetch_graph":"https://pith.science/api/pith-number/EV5DV3TKMKTOAME3JTNEJXD6FE/graph.json","fetch_events":"https://pith.science/api/pith-number/EV5DV3TKMKTOAME3JTNEJXD6FE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE/action/storage_attestation","attest_author":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE/action/author_attestation","sign_citation":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE/action/citation_signature","submit_replication":"https://pith.science/pith/EV5DV3TKMKTOAME3JTNEJXD6FE/action/replication_record"}},"created_at":"2026-07-05T11:18:31.613378+00:00","updated_at":"2026-07-05T11:18:31.613378+00:00"}