{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:WBLNDC4WC32SMOC7OXCKCIVHSR","short_pith_number":"pith:WBLNDC4W","schema_version":"1.0","canonical_sha256":"b056d18b9616f526385f75c4a122a794537a36e8cc973a0047548ca8906231ee","source":{"kind":"arxiv","id":"2407.14207","version":5},"attestation_state":"computed","paper":{"title":"Longhorn: State Space Models are Amortized Online Learners","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bo Liu, Lemeng Wu, Peter Stone, Qiang Liu, Rui Wang, Yihao Feng","submitted_at":"2024-07-19T11:12:08Z","abstract_excerpt":"Modern large language models are built on sequence modeling via next-token prediction. While the Transformer remains the dominant architecture for sequence modeling, its quadratic decoding complexity in sequence length poses a major limitation. State-space models (SSMs) present a competitive alternative, offering linear decoding efficiency while maintaining parallelism during training. However, most existing SSMs rely on linear recurrence designs that appear somewhat ad hoc. In this work, we explore SSM design through the lens of online learning, conceptualizing SSMs as meta-modules for specif"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.14207","kind":"arxiv","version":5},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-19T11:12:08Z","cross_cats_sorted":[],"title_canon_sha256":"94e83158b6b85c5a69516ac1becf42f912a26e0ed34993067c55657196f9157c","abstract_canon_sha256":"f22df65934565f995052f126122dfaa373114356f485e282016ac440dfa459c2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:14:35.883066Z","signature_b64":"7H/Rihvd7ojsZPnhpPYtJavRNyBUBof6pOFlywPQQOICuzyXdesqZEbQgi75vpZBMLd8wDrwqzbAI+0Er4MyDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b056d18b9616f526385f75c4a122a794537a36e8cc973a0047548ca8906231ee","last_reissued_at":"2026-07-05T09:14:35.882513Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:14:35.882513Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Longhorn: State Space Models are Amortized Online Learners","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bo Liu, Lemeng Wu, Peter Stone, Qiang Liu, Rui Wang, Yihao Feng","submitted_at":"2024-07-19T11:12:08Z","abstract_excerpt":"Modern large language models are built on sequence modeling via next-token prediction. While the Transformer remains the dominant architecture for sequence modeling, its quadratic decoding complexity in sequence length poses a major limitation. State-space models (SSMs) present a competitive alternative, offering linear decoding efficiency while maintaining parallelism during training. However, most existing SSMs rely on linear recurrence designs that appear somewhat ad hoc. In this work, we explore SSM design through the lens of online learning, conceptualizing SSMs as meta-modules for specif"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.14207","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.14207/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.14207","created_at":"2026-07-05T09:14:35.882568+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.14207v5","created_at":"2026-07-05T09:14:35.882568+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.14207","created_at":"2026-07-05T09:14:35.882568+00:00"},{"alias_kind":"pith_short_12","alias_value":"WBLNDC4WC32S","created_at":"2026-07-05T09:14:35.882568+00:00"},{"alias_kind":"pith_short_16","alias_value":"WBLNDC4WC32SMOC7","created_at":"2026-07-05T09:14:35.882568+00:00"},{"alias_kind":"pith_short_8","alias_value":"WBLNDC4W","created_at":"2026-07-05T09:14:35.882568+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07706","citing_title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","ref_index":10,"is_internal_anchor":true},{"citing_arxiv_id":"2606.23670","citing_title":"Tapered Language Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11634","citing_title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08804","citing_title":"Q-Delta: Beyond Key-Value Associative State Evolution","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31163","citing_title":"Memory by Design: Probabilistic Sequence Layers","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2509.24552","citing_title":"Short window attention enables long-term memorization","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2509.26645","citing_title":"TTT3R: 3D Reconstruction as Test-Time Training","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2602.21204","citing_title":"Test-Time Training with KV Binding Is Secretly Linear Attention","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2501.00663","citing_title":"Titans: Learning to Memorize at Test Time","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13473","citing_title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2510.26692","citing_title":"Kimi Linear: An Expressive, Efficient Attention Architecture","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2412.06464","citing_title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","ref_index":278,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08587","citing_title":"Kaczmarz Linear Attention","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05838","citing_title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","ref_index":92,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19021","citing_title":"FG$^2$-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21100","citing_title":"Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR","json":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR.json","graph_json":"https://pith.science/api/pith-number/WBLNDC4WC32SMOC7OXCKCIVHSR/graph.json","events_json":"https://pith.science/api/pith-number/WBLNDC4WC32SMOC7OXCKCIVHSR/events.json","paper":"https://pith.science/paper/WBLNDC4W"},"agent_actions":{"view_html":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR","download_json":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR.json","view_paper":"https://pith.science/paper/WBLNDC4W","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.14207&json=true","fetch_graph":"https://pith.science/api/pith-number/WBLNDC4WC32SMOC7OXCKCIVHSR/graph.json","fetch_events":"https://pith.science/api/pith-number/WBLNDC4WC32SMOC7OXCKCIVHSR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR/action/storage_attestation","attest_author":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR/action/author_attestation","sign_citation":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR/action/citation_signature","submit_replication":"https://pith.science/pith/WBLNDC4WC32SMOC7OXCKCIVHSR/action/replication_record"}},"created_at":"2026-07-05T09:14:35.882568+00:00","updated_at":"2026-07-05T09:14:35.882568+00:00"}