{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2DTFHXENVTUOQZ37CRCF5D7Q5G","short_pith_number":"pith:2DTFHXEN","schema_version":"1.0","canonical_sha256":"d0e653dc8dace8e8677f14445e8ff0e99ad53abe1c737d160c9a04d96f6b1412","source":{"kind":"arxiv","id":"2412.09764","version":2},"attestation_state":"computed","paper":{"title":"Memory Layers at Scale","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Barlas O\\u{g}uz, Daniel Haziza, Gargi Ghosh, Luke Zettlemoyer, Vincent-Pierre Berges, Wen-tau Yih","submitted_at":"2024-12-12T23:56:57Z","abstract_excerpt":"Memory layers use a trainable key-value lookup mechanism to add extra parameters to a model without increasing FLOPs. Conceptually, sparsely activated memory layers complement compute-heavy dense feed-forward layers, providing dedicated capacity to store and retrieve information cheaply. This work takes memory layers beyond proof-of-concept, proving their utility at contemporary scale. On downstream tasks, language models augmented with our improved memory layer outperform dense models with more than twice the computation budget, as well as mixture-of-expert models when matched for both comput"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.09764","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-12-12T23:56:57Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"5fb5c916b5e9cbcb6aba5a96f85c2a8dff37f2312cd568e534a0c5695c7aa4ae","abstract_canon_sha256":"a0b88793ec38d757ad718bea5258adc504167d76c880db7d30059c1aaeb2f190"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:52:19.109092Z","signature_b64":"+H7OaIMWfXeGkUDGCNafjjLJCK1fz4xMl1W7d6lB2mL+pYefNyaUlPol8gYaHAaTgXUkeUek+25w6ufxKS/SCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d0e653dc8dace8e8677f14445e8ff0e99ad53abe1c737d160c9a04d96f6b1412","last_reissued_at":"2026-07-05T09:52:19.108556Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:52:19.108556Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Memory Layers at Scale","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Barlas O\\u{g}uz, Daniel Haziza, Gargi Ghosh, Luke Zettlemoyer, Vincent-Pierre Berges, Wen-tau Yih","submitted_at":"2024-12-12T23:56:57Z","abstract_excerpt":"Memory layers use a trainable key-value lookup mechanism to add extra parameters to a model without increasing FLOPs. Conceptually, sparsely activated memory layers complement compute-heavy dense feed-forward layers, providing dedicated capacity to store and retrieve information cheaply. This work takes memory layers beyond proof-of-concept, proving their utility at contemporary scale. On downstream tasks, language models augmented with our improved memory layer outperform dense models with more than twice the computation budget, as well as mixture-of-expert models when matched for both comput"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.09764","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.09764/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.09764","created_at":"2026-07-05T09:52:19.108615+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.09764v2","created_at":"2026-07-05T09:52:19.108615+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.09764","created_at":"2026-07-05T09:52:19.108615+00:00"},{"alias_kind":"pith_short_12","alias_value":"2DTFHXENVTUO","created_at":"2026-07-05T09:52:19.108615+00:00"},{"alias_kind":"pith_short_16","alias_value":"2DTFHXENVTUOQZ37","created_at":"2026-07-05T09:52:19.108615+00:00"},{"alias_kind":"pith_short_8","alias_value":"2DTFHXEN","created_at":"2026-07-05T09:52:19.108615+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07386","citing_title":"Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity","ref_index":82,"is_internal_anchor":true},{"citing_arxiv_id":"2606.20737","citing_title":"Repeated Shared Access Enables Grokking, but Edit Propagation Depends on an Addressable Memory","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03229","citing_title":"Sparse Memory Finetuning as a Low-Forgetting Alternative to LoRA and Full Finetuning","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28876","citing_title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2501.00663","citing_title":"Titans: Learning to Memorize at Test Time","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23388","citing_title":"A Parametric Memory Head for Continual Generative Retrieval","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11628","citing_title":"Back to Basics: Let Conversational Agents Remember with Just Retrieval and Generation","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G","json":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G.json","graph_json":"https://pith.science/api/pith-number/2DTFHXENVTUOQZ37CRCF5D7Q5G/graph.json","events_json":"https://pith.science/api/pith-number/2DTFHXENVTUOQZ37CRCF5D7Q5G/events.json","paper":"https://pith.science/paper/2DTFHXEN"},"agent_actions":{"view_html":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G","download_json":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G.json","view_paper":"https://pith.science/paper/2DTFHXEN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.09764&json=true","fetch_graph":"https://pith.science/api/pith-number/2DTFHXENVTUOQZ37CRCF5D7Q5G/graph.json","fetch_events":"https://pith.science/api/pith-number/2DTFHXENVTUOQZ37CRCF5D7Q5G/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G/action/storage_attestation","attest_author":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G/action/author_attestation","sign_citation":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G/action/citation_signature","submit_replication":"https://pith.science/pith/2DTFHXENVTUOQZ37CRCF5D7Q5G/action/replication_record"}},"created_at":"2026-07-05T09:52:19.108615+00:00","updated_at":"2026-07-05T09:52:19.108615+00:00"}