{"as_of":"2026-08-22T01:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56efda9c9a511210ffefc1561468176a92d486fed81c6441cf65062326643e10","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:49:54.751347Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:56:40.709328Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T12:46:14.687769Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-11T12:03:42.171065Z","title":"Memory layers at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14711","last_updated":"2025-02-27T16:33:09Z","snapshot_observed_at":"2026-08-14T22:43:45.227916Z","submitted_at":"2024-12-19T10:21:20Z","title":"ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:03:42.171065Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2412.14711"},"observation_digest":"sha256:95de7f740f2af773dc4fe014269dee5c6dde945cd5a4a325bf370ac75f15eddd","observation_id":"09a8d0a3-aef7-470e-8556-69f5a416f31b","resolution":{"observed_at":"2026-08-11T12:03:42.171065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":"2412.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-09T12:46:14.687769Z","title":"Memory Layers at Scale","venue":"cs.CL","work_id":"1dda7439-5e69-419c-8344-89e437a3e1dd","year":2024},"citing_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-16T10:45:05.594811Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T22:08:14.982302Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2501.00663"},"observation_digest":"sha256:ba3fbd33f479341b72ebea8be3e26c798bc8945be329ee7417f99cb8f70fad87","observation_id":"17da46ac-9091-454c-be6d-c9f559710779","resolution":{"observed_at":"2026-05-14T22:08:15.372893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-08T14:13:37.950838Z","title":"Memory layers at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06975","last_updated":"2025-02-10T19:14:51Z","snapshot_observed_at":"2026-08-14T08:32:12.525435Z","submitted_at":"2025-02-10T19:14:51Z","title":"Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:13:37.950838Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2502.06975"},"observation_digest":"sha256:398bc848b275a14ef536e6317b43717273deac6f1c38d78982001001f4b777e7","observation_id":"24b3b3aa-0530-47d8-bd9b-f803dedc0a43","resolution":{"observed_at":"2026-08-08T14:13:37.950838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-15T19:56:40.709328Z","title":"Memory layers at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14761","last_updated":"2025-06-17T17:55:11Z","snapshot_observed_at":"2026-08-15T19:44:59.254691Z","submitted_at":"2025-06-17T17:55:11Z","title":"From Bytes to Ideas: Language Modeling with Autoregressive U-Nets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:56:40.709328Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2506.14761"},"observation_digest":"sha256:ddc631364d2127405e72ccd78eb6b8b44b9547fccee4bd54ce78501e9f786c70","observation_id":"bb5c5be0-96ea-4c15-9f30-786d5888cdaf","resolution":{"observed_at":"2026-08-15T19:56:40.709328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-05T21:05:45.188392Z","title":"Memory layers at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09494","last_updated":"2025-08-13T04:54:43Z","snapshot_observed_at":"2026-08-19T20:46:12.089547Z","submitted_at":"2025-08-13T04:54:43Z","title":"Learning Facts at Scale with Active Reading","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T21:05:45.188392Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2508.09494"},"observation_digest":"sha256:1b5336d1109a49028ec6242ae6b22fd00c26c4cc87da9233dfb7b5b6539dd4e5","observation_id":"4b3655e1-a9bd-4695-b72f-48ff463a6ddf","resolution":{"observed_at":"2026-08-05T21:05:45.188392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-05T20:15:47.770663Z","title":"Memory layers at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10824","last_updated":"2025-08-16T03:17:35Z","snapshot_observed_at":"2026-08-15T08:57:34.866483Z","submitted_at":"2025-08-14T16:48:38Z","title":"Memory-Augmented Transformers: A Systematic Review from Neuroscience Principles to Enhanced Model Architectures","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:47.770663Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2508.10824"},"observation_digest":"sha256:1f19f8db48c0c4659ac6f5af884a38b086327dd3ccf4f4031b40546473f7f851","observation_id":"e140f4af-107e-4240-a8c5-f9d63a2a6042","resolution":{"observed_at":"2026-08-05T20:15:47.770663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-05T16:17:41.871650Z","title":"Memory layers at scale.arXiv preprint arXiv:2412.09764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-20T23:44:48.149491Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.871650Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:dc6fee6107ed0b98541e2a918fcf3a3bbbede2acac6704bd006b97529fb5120c","observation_id":"bf4eed67-8daf-4c43-8846-cac6c833c7be","resolution":{"observed_at":"2026-08-05T16:17:41.871650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":"2412.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-09T12:46:14.687769Z","title":"Memory Layers at Scale","venue":"cs.CL","work_id":"1dda7439-5e69-419c-8344-89e437a3e1dd","year":2024},"citing_paper":{"arxiv_id":"2604.11628","last_updated":"2026-04-13T15:38:43Z","snapshot_observed_at":"2026-08-12T23:02:57.206014Z","submitted_at":"2026-04-13T15:38:43Z","title":"Back to Basics: Let Conversational Agents Remember with Just Retrieval and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:27:00.693277Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2604.11628"},"observation_digest":"sha256:036888a484eae02de222ef985f39f1180ae7bbbdf6e58c310674928d069490df","observation_id":"0e8e3380-490d-4494-bb96-015b907499f7","resolution":{"observed_at":"2026-05-11T10:31:03.674020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":"2412.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-09T12:46:14.687769Z","title":"Memory Layers at Scale","venue":"cs.CL","work_id":"1dda7439-5e69-419c-8344-89e437a3e1dd","year":2024},"citing_paper":{"arxiv_id":"2604.23388","last_updated":"2026-04-25T17:38:51Z","snapshot_observed_at":"2026-08-11T01:09:41.455400Z","submitted_at":"2026-04-25T17:38:51Z","title":"A Parametric Memory Head for Continual Generative Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T07:17:36.002595Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2604.23388"},"observation_digest":"sha256:e5e93156fc010d8581ddcad06658f819e2cb664f9830b0cada74601b3f71d3b4","observation_id":"3bce37f9-ac6e-4752-afbf-cf9cecc7a6b9","resolution":{"observed_at":"2026-05-11T21:01:13.450367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":"2412.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-09T12:46:14.687769Z","title":"Memory Layers at Scale","venue":"cs.CL","work_id":"1dda7439-5e69-419c-8344-89e437a3e1dd","year":2024},"citing_paper":{"arxiv_id":"2605.03229","last_updated":"2026-06-08T16:26:11Z","snapshot_observed_at":"2026-08-14T21:03:39.288998Z","submitted_at":"2026-05-04T23:46:40Z","title":"Sparse Memory Finetuning as a Low-Forgetting Alternative to LoRA and Full Finetuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T23:53:13.453684Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2605.03229"},"observation_digest":"sha256:af13a54082ef610293abc43d8626c6efa72b8925236bed7534bee355bec6d511","observation_id":"1f5e1ca7-395f-44b7-b4f8-4de4a0699aa3","resolution":{"observed_at":"2026-07-01T00:55:12.744308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":"2412.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-09T12:46:14.687769Z","title":"Memory Layers at Scale","venue":"cs.CL","work_id":"1dda7439-5e69-419c-8344-89e437a3e1dd","year":2024},"citing_paper":{"arxiv_id":"2606.20737","last_updated":"2026-06-23T11:42:49Z","snapshot_observed_at":"2026-08-17T18:16:56.316236Z","submitted_at":"2026-06-17T15:52:08Z","title":"Repeated Shared Access Enables Grokking, but Edit Propagation Depends on an Addressable Memory","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T20:43:55.740662Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2606.20737"},"observation_digest":"sha256:dc740b95a7eeaf9055f5807aa3e0dcdedad250b0748719700a5b52c5bb05cc2e","observation_id":"2261a4d7-4e28-430e-8f14-a2dcd9a761d2","resolution":{"observed_at":"2026-07-04T01:09:18.556609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":"2412.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-09T12:46:14.687769Z","title":"Memory Layers at Scale","venue":"cs.CL","work_id":"1dda7439-5e69-419c-8344-89e437a3e1dd","year":2024},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-08-12T17:19:42Z","snapshot_observed_at":"2026-08-15T23:12:08.948009Z","submitted_at":"2026-06-27T11:38:43Z","title":"MMLA: How Memory Lets the Past Shape the Future","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:57.030469Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:7e6632ab53625d048a0b74fda4eabc663386f7008b2cfe65eefcd8cd492edfb2","observation_id":"aee20ed8-a835-4d64-bd38-9ce99da4be54","resolution":{"observed_at":"2026-06-30T09:54:35.289983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-13T07:16:45.194991Z","title":"Memory Layers at Scale.https://arxiv.org/abs/2412.09764,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-08-12T17:19:42Z","snapshot_observed_at":"2026-08-15T23:12:08.948009Z","submitted_at":"2026-06-27T11:38:43Z","title":"MMLA: How Memory Lets the Past Shape the Future","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T07:16:45.194991Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:41f124d0c3904237b8c3ad5dce44f9dbac70b9f9539f36acd35766bc668e9c38","observation_id":"d0c6d221-4324-45ef-b6ea-af2e7b5f1a1c","resolution":{"observed_at":"2026-07-13T07:16:45.194991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":"2412.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-09T12:46:14.687769Z","title":"Memory Layers at Scale","venue":"cs.CL","work_id":"1dda7439-5e69-419c-8344-89e437a3e1dd","year":2024},"citing_paper":{"arxiv_id":"2607.07386","last_updated":"2026-07-08T13:17:19Z","snapshot_observed_at":"2026-08-14T04:55:39.534906Z","submitted_at":"2026-07-08T13:17:19Z","title":"Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-09T12:40:09.036905Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2607.07386"},"observation_digest":"sha256:83128f03347f672493470073ddbfa32f7b9ae46a9aa7ccaadd67d9453509853d","observation_id":"db58455a-e42c-47a6-ab81-a8cb8c86c722","resolution":{"observed_at":"2026-07-09T12:46:14.688901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-07-14T07:36:43.499258Z","title":"Memory layers at scale.arXiv preprint arXiv:2412.09764,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11020","last_updated":"2026-07-14T05:59:33Z","snapshot_observed_at":"2026-08-13T03:17:32.507445Z","submitted_at":"2026-07-13T02:39:38Z","title":"Can a Language Model Learn Facts Continually in Its Weights?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T07:36:43.499258Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2607.11020"},"observation_digest":"sha256:d299636e01d3b25640e85b63d3094a6214b4966925ed90285ade62a19ed1e811","observation_id":"af5af27d-ee1a-4a41-9fdf-cae88ddcec9e","resolution":{"observed_at":"2026-07-14T07:36:43.499258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-02T09:48:57.754044Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16254","last_updated":"2026-06-27T10:21:07Z","snapshot_observed_at":"2026-08-19T03:08:17.813760Z","submitted_at":"2026-06-27T10:21:07Z","title":"More Than Memory: Task-Conditioned Signed FFN Writes in Long-Context Retrieval","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T09:48:57.754044Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2607.16254"},"observation_digest":"sha256:cd0f1dc8ad7126d565fb1adc2a233531031452c649298aa21ef7d12978ff7015","observation_id":"2e294914-58df-4a05-bdec-8198211f542f","resolution":{"observed_at":"2026-08-02T09:48:57.754044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-01T01:59:49.773747Z","title":"Memory layers at scale.arXiv preprint arXiv:2412.09764,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25614","last_updated":"2026-07-28T11:45:34Z","snapshot_observed_at":"2026-08-19T06:31:44.298606Z","submitted_at":"2026-07-28T11:45:34Z","title":"MemSFT: Mitigating Alignment Tax with an External Parametric Memory","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T01:59:49.773747Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2607.25614"},"observation_digest":"sha256:1e5e2f52b0f2f187e48ba9cfc957443170ed78e6d806de102929c779304bc100","observation_id":"434605c4-975c-4aee-81f8-030c3887a850","resolution":{"observed_at":"2026-08-01T01:59:49.773747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09764/citation-record","integrity":"/paper/2412.09764/integrity","json":"/paper/2412.09764/citation-record.json","paper":"/paper/2412.09764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.594958Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.594958Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:ffabe5f915e24c2d182a6bc76a14c7975c88ca9fc7b693ff142cb317de618dea","observation_id":"2a3eb023-b44c-4ea8-839d-72aa1e3cb487","resolution":{"observed_at":"2026-08-11T16:49:54.594958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-11T16:49:54.600190Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.600190Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:a2cce2cad1a2ea5f005d0a1946e938fcdd48ad779ac90ce86176ef4b3ce19aad","observation_id":"adb2c361-1cee-46c2-84bb-42e64ea97fee","resolution":{"observed_at":"2026-08-11T16:49:54.600190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-18T12:17:42.484599Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-11T16:49:54.604151Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.604151Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:07cacdb9e81b443c3a086619ec92aadbcdeb0923bda37f64d597300f057b20be","observation_id":"531483af-c6ab-4ac0-bc5c-08d50709253e","resolution":{"observed_at":"2026-08-11T16:49:54.604151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-11T16:49:54.607753Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.607753Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:fc2e0982f5c442356442c78fd74a306c10dd25cdfb052e94fdfd2bbc748945ff","observation_id":"6f894b6b-7aec-4bef-a0d8-59f027e1ba25","resolution":{"observed_at":"2026-08-11T16:49:54.607753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T16:49:54.611395Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, and Amanda Askell et","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.611395Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:30d2499b05b89e8f9ed642466d4d3b3f74a0b77705a12c7add1bd5585963d73a","observation_id":"ef976e39-9b65-4a6f-b903-32fc1305a19b","resolution":{"observed_at":"2026-08-11T16:49:54.611395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.614983Z","title":"Open-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.614983Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:a85f9fb610b090e30187a57ef57bdc9c241ad5be204c681efb6bc6734172f8f7","observation_id":"ff8d2448-06c4-417a-9142-b143ecf06598","resolution":{"observed_at":"2026-08-11T16:49:54.614983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00051","last_updated":"2017-04-28T03:53:14Z","snapshot_observed_at":"2026-08-21T02:21:43.569667Z","submitted_at":"2017-03-31T20:39:10Z","title":"Reading Wikipedia to Answer Open-Domain Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00051","snapshot_observed_at":"2026-08-11T16:49:54.618492Z","title":"Reading wikipedia to answer open-domain questions, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.618492Z"},"links":{"cited_paper":"/paper/1704.00051","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:52eadd24751dd23e079a7be64749f389a3aaf33cdee129532bfb9222f1f515b4","observation_id":"716ea335-e8c3-496d-a0f1-118580501f6e","resolution":{"observed_at":"2026-08-11T16:49:54.618492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T16:49:54.622329Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.622329Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:e2c73cc8856836b288115b7e7a769af048144d17ad22a705dcd166caf97ca729","observation_id":"05d21a5b-c452-47ac-9051-80ff075bcade","resolution":{"observed_at":"2026-08-11T16:49:54.622329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T16:49:54.625959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.625959Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:eefe586ebcfe2b32aff32dacfaf8fab85e5eae33050f8ab7ac405b3d8e70b654","observation_id":"fd0cf9bb-c2b0-44ea-97a0-007c3717d962","resolution":{"observed_at":"2026-08-11T16:49:54.625959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.629445Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.629445Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:5a51857b9724da22fbb8b67a9da2e9ada7971cad8d4abaf041bf97dcdf34927c","observation_id":"e1d98f02-8e13-4095-bf85-d3badd030940","resolution":{"observed_at":"2026-08-11T16:49:54.629445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-12T12:07:42.706444Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-11T16:49:54.632638Z","title":"Neural turing machines, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.632638Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:2a1e65311b7abdb288b071b6dd8a41191d5af76f76bf889bb69a6374cc307127","observation_id":"4153e1bc-ef37-4348-941f-636661813dc1","resolution":{"observed_at":"2026-08-11T16:49:54.632638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.636324Z","title":"Hybrid computing using a neural network with dynamic external memory","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.636324Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:82056f878b2f2058ef3cfee7b99a74446853d48f20e5ad101ebb81040287a16e","observation_id":"dd5a8adf-2b63-4e33-86d9-ee7543109bcd","resolution":{"observed_at":"2026-08-11T16:49:54.636324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-11T16:49:54.639355Z","title":"Realm: Retrieval-augmented language model pre-training, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.639355Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:2b0ffc8f9ff4e0c57f4d1f70a547b971d525f33f89f2c845833fb5af97aac479","observation_id":"473ea390-6396-4a0d-b0b5-2137acf16cbb","resolution":{"observed_at":"2026-08-11T16:49:54.639355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-17T15:59:54.117281Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-11T16:49:54.642697Z","title":"Mixture of a million experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.642697Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:44dad7132a137febd8173a4fcff99cb97565c55244c9d2781e411d008a498791","observation_id":"382e92d6-fb07-4aed-aa86-e77381be2aed","resolution":{"observed_at":"2026-08-11T16:49:54.642697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-11T16:49:54.646237Z","title":"Gaussian error linear units (gelus), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.646237Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:d7b01e73730e3e853f6a7bd8f22b0c6e768562606e45516b13d1b54541e0d059","observation_id":"4142308d-3601-4bb1-96f9-a6c9f19c74aa","resolution":{"observed_at":"2026-08-11T16:49:54.646237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-11T16:49:54.649976Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.649976Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:19cb71dc788843c814c00f9c7c6a0be26b84f4256eb55d40aeb41f2187f835d0","observation_id":"9b96f134-7aca-4b63-b0b8-d9f18e6b7707","resolution":{"observed_at":"2026-08-11T16:49:54.649976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.653457Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.653457Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:a33a187e3474c9db932cba0d5dc56e6d80387cb88b19e16b3136d5cbe69d908f","observation_id":"5e45159d-77ea-4ccc-b173-ac1a95a66816","resolution":{"observed_at":"2026-08-11T16:49:54.653457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.656774Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.656774Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:3cc165d0daed9ed277931e8ff0d5123e17bf92405734a8d1ad21847ec756010c","observation_id":"cddb954d-22e7-4b22-9fb9-94433cd9669f","resolution":{"observed_at":"2026-08-11T16:49:54.656774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-11T16:49:54.660107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.660107Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:8601c01bc83b9c7ba054a3d24339824c616b514bbe545c15d6198f3708bd860b","observation_id":"0d5231ed-2257-4e6a-a1e5-b3369b8bc69f","resolution":{"observed_at":"2026-08-11T16:49:54.660107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.663630Z","title":"Billion-scale similarity search with GPUs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.663630Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:d5c296b0e699987e32a0615b4472fe7c10a37feeecbf5c15315daa39ab746370","observation_id":"40eff1cf-cfec-40d6-8a16-7d24ffe33938","resolution":{"observed_at":"2026-08-11T16:49:54.663630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-11T16:49:54.666708Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.666708Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:23f74b33b093e83735acb33099897ac106a34bf7760fb71705ee43f873f1b39c","observation_id":"fee48aaf-a228-4a69-ba43-e1c03cfa5b7b","resolution":{"observed_at":"2026-08-11T16:49:54.666708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T16:49:54.670325Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.670325Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:58db381a7962fe8ee9520ed9d2ea8685351e554ca25f54c1cd00dae8a8bbaa8e","observation_id":"838feed6-81d5-4ad9-ae13-f57b6b604677","resolution":{"observed_at":"2026-08-11T16:49:54.670325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04906","last_updated":"2020-09-30T21:27:13Z","snapshot_observed_at":"2026-07-06T09:11:26.109763Z","submitted_at":"2020-04-10T04:53:17Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04906","snapshot_observed_at":"2026-08-11T16:49:54.673846Z","title":"Dense passage retrieval for open-domain question answering, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.673846Z"},"links":{"cited_paper":"/paper/2004.04906","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:f439b21b8b284121985cd2e0cf3e2f48cb907e30b9f580b209826dd3a0d1bf9e","observation_id":"ef02867a-441f-4790-8768-f7f68676f479","resolution":{"observed_at":"2026-08-11T16:49:54.673846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00172","last_updated":"2020-02-15T01:04:52Z","snapshot_observed_at":"2026-08-19T23:36:22.412635Z","submitted_at":"2019-11-01T01:09:53Z","title":"Generalization through Memorization: Nearest Neighbor Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00172","snapshot_observed_at":"2026-08-11T16:49:54.677434Z","title":"Generalization through memorization: Nearest neighbor language models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.677434Z"},"links":{"cited_paper":"/paper/1911.00172","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:ff48e5e385b4bc0842d8c184e126fa6d39f7ae9fa04967fbe320e004aa543ad9","observation_id":"57dff3b2-b629-4b5b-9fc8-511538dd3c37","resolution":{"observed_at":"2026-08-11T16:49:54.677434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:54.681198Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.681198Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:6cc3c634b50632ac3da350ffa20509b6816b91e0c06d2d7c553f601c8c733636","observation_id":"2a444b20-fdcc-4bfb-a030-afca5a9c67eb","resolution":{"observed_at":"2026-08-11T16:49:54.681198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05242","last_updated":"2019-12-16T03:46:57Z","snapshot_observed_at":"2026-08-18T20:34:35.435830Z","submitted_at":"2019-07-10T14:52:12Z","title":"Large Memory Layers with Product Keys","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05242","snapshot_observed_at":"2026-08-11T16:49:54.684836Z","title":"Large memory layers with product keys, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.684836Z"},"links":{"cited_paper":"/paper/1907.05242","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:efdf7edc5d98e09e1f95f01e2ab392b09141d4ee0fd0fb2828543f1b3a56f548","observation_id":"b2a2080b-3db1-4d6c-bf29-cf5102d0d924","resolution":{"observed_at":"2026-08-11T16:49:54.684836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00300","last_updated":"2019-06-27T21:06:12Z","snapshot_observed_at":"2026-08-16T14:19:32.455632Z","submitted_at":"2019-06-01T22:02:39Z","title":"Latent Retrieval for Weakly Supervised Open Domain Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00300","snapshot_observed_at":"2026-08-11T16:49:54.688409Z","title":"Latent retrieval for weakly supervised open domain question answering, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.688409Z"},"links":{"cited_paper":"/paper/1906.00300","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:956a432b1426d5a1c1cf7cef38c1ffb73021d3817ce8446557a4ec2cec0890e4","observation_id":"abf90d65-4fa1-4ed8-836f-246d9fb1ba02","resolution":{"observed_at":"2026-08-11T16:49:54.688409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-11T16:49:54.691948Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.691948Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:875dacd47d866d4f9292d045a7679db7e47c0a6b6c119db54f5484b9215efbc4","observation_id":"9e1f3eb4-51fa-4685-881a-dbab67a7d417","resolution":{"observed_at":"2026-08-11T16:49:54.691948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-11T16:49:54.695388Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.695388Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:9b32ae4c5a18f76b7f56d481a89a67779b78aa06a6a24b52fbeac6593bc47148","observation_id":"25319b52-3a50-416a-9e70-5db663f6652b","resolution":{"observed_at":"2026-08-11T16:49:54.695388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-11T16:49:54.699004Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.699004Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:70c7e7c8223ef85b4fd26ec2580c11c46b440b5515b697ac19bf165259a97cbf","observation_id":"d1e7de66-343d-4cf5-959a-b01ee5d861b9","resolution":{"observed_at":"2026-08-11T16:49:54.699004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T16:49:54.702690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.702690Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:0b2b42908d36012f43cb88aa3fbd9d09f2f119bbd4657ae2bc3148df78a10ba1","observation_id":"0e642f76-bb90-442a-81e5-77877a654a32","resolution":{"observed_at":"2026-08-11T16:49:54.702690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.02252","last_updated":"2021-05-27T15:20:59Z","snapshot_observed_at":"2026-08-15T21:54:51.990010Z","submitted_at":"2020-09-04T15:32:19Z","title":"KILT: a Benchmark for Knowledge Intensive Language Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.02252","snapshot_observed_at":"2026-08-11T16:49:54.705977Z","title":"Kilt: a benchmark for knowledge intensive language tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.705977Z"},"links":{"cited_paper":"/paper/2009.02252","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:e755059d37be2437b39ed165ffd6255ecc67d5d85c4753868a87144c39b77043","observation_id":"04da0a76-7c8d-47bf-b61e-4fa9646afae3","resolution":{"observed_at":"2026-08-11T16:49:54.705977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08910","last_updated":"2020-10-05T21:26:45Z","snapshot_observed_at":"2026-08-15T17:58:46.639035Z","submitted_at":"2020-02-10T18:55:58Z","title":"How Much Knowledge Can You Pack Into the Parameters of a Language Model?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08910","snapshot_observed_at":"2026-08-11T16:49:54.709459Z","title":"How much knowledge can you pack into the parameters of a language model?, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.709459Z"},"links":{"cited_paper":"/paper/2002.08910","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:6aee7eec8e2b81f4da118516684a29c7c112fe54c37fd4ed6d8322f81ec5aacd","observation_id":"31b5175b-9755-43fd-9c53-8285637b6543","resolution":{"observed_at":"2026-08-11T16:49:54.709459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15004","last_updated":"2023-05-22T15:56:25Z","snapshot_observed_at":"2026-08-18T17:35:22.963054Z","submitted_at":"2023-04-28T17:52:11Z","title":"Are Emergent Abilities of Large Language Models a Mirage?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15004","snapshot_observed_at":"2026-08-11T16:49:54.712976Z","title":"Are emergent abilities of large language models a mirage?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.712976Z"},"links":{"cited_paper":"/paper/2304.15004","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:b5ad71ee2a6615e077d15bfb00bfb18d69247cfdfdd18f1de1910fc15d783cc1","observation_id":"fd6864ec-c709-4487-b89e-36acd8a66268","resolution":{"observed_at":"2026-08-11T16:49:54.712976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-11T16:49:54.716493Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.716493Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:c50c7167f7d364902a97998736efaceddb223d96e2bed40aca9503895581b291","observation_id":"c39b6222-6b8c-4867-9ac9-cac6746dbeed","resolution":{"observed_at":"2026-08-11T16:49:54.716493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:49:55.288795Z","title":"End-to-end memory networks","venue":null,"work_id":"9e248404-9279-4ebe-b469-3b19a7e281f7","year":2015},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.719987Z"},"links":{"citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:f905dd5d3698673a41f2db6205f3f3d2007da4399f4b36c6ce0db0d4635fd591","observation_id":"7194aed6-5dff-41a8-ab08-e1137e391585","resolution":{"observed_at":"2026-08-11T16:49:55.293520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T16:49:54.723262Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.723262Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:79113784f53603878c57a9faff10954aa387b73ef3342dcb8e61fa79bae7452c","observation_id":"7f255909-86f5-4813-86c5-4c36626633d7","resolution":{"observed_at":"2026-08-11T16:49:54.723262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T16:49:54.726687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.726687Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:d77cfea7cc1a6f8b2ffec9fa44139ab9cdc8f9b04041195a2ac1af6674111eba","observation_id":"450455dd-06ea-42d7-b445-2668551d71c7","resolution":{"observed_at":"2026-08-11T16:49:54.726687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T16:49:54.730072Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.730072Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:699a435c54cd43dc2b76748dd10482c6c27123b03818e03f80a71051d75ef663","observation_id":"c7bfb580-4a97-4fa3-8338-96f42c6394e0","resolution":{"observed_at":"2026-08-11T16:49:54.730072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-11T16:49:54.733591Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.733591Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:76bb6416674fa7b8fcfc9ba1161fa40778e2f78b98a23224d6317feec23383d0","observation_id":"5bdaf2f9-beba-4e2a-9a8f-8d63af3d1f34","resolution":{"observed_at":"2026-08-11T16:49:54.733591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-11T16:49:54.736619Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.736619Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:a6c299e64db803b7f4500cdb36b8659f77592b5e720c50fb969c25e7a99558d8","observation_id":"006e381f-f000-4a32-9e75-5bba70abe133","resolution":{"observed_at":"2026-08-11T16:49:54.736619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.3916","last_updated":"2015-11-29T07:00:41Z","snapshot_observed_at":"2026-08-18T21:39:55.063245Z","submitted_at":"2014-10-15T03:13:18Z","title":"Memory Networks","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.3916","snapshot_observed_at":"2026-08-11T16:49:54.740859Z","title":"Memory networks, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.740859Z"},"links":{"cited_paper":"/paper/1410.3916","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:67992b90f2a7b4b974acbec44fb333aea3a3750eca3e622051fc97996f28a998","observation_id":"27f4ddd2-8ac4-4565-b6c2-c89b9fd0162d","resolution":{"observed_at":"2026-08-11T16:49:54.740859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-17T01:54:11.006899Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-11T16:49:54.744339Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.744339Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:cf21ccc8657a25b153c142793b0addbd5fb0e1702e82e554eaeb23c3ebcf73df","observation_id":"01bc4761-4976-4d5d-b81f-8185e058769b","resolution":{"observed_at":"2026-08-11T16:49:54.744339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-11T16:49:54.747832Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.747832Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:dfefe36443ee8333cc60d967f1e27614609a111dc9e4f2227b1a41c9d8b0ff4b","observation_id":"dca1bcd5-084a-422b-8deb-dfd7dd628647","resolution":{"observed_at":"2026-08-11T16:49:54.747832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-16T17:20:15.597859Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-11T16:49:54.751347Z","title":"Mixture-of-experts with expert choice routing, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T16:49:54.751347Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2412.09764"},"observation_digest":"sha256:5c7259bb7cd731c19cd6eb7b677e3e5700a68d9bb987fd09f6dd45521bcfaade","observation_id":"629cc6e1-a39d-47ef-ac4a-78f4a3327ced","resolution":{"observed_at":"2026-08-11T16:49:54.751347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T03:24:42.718431Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 17 inbound Pith citation observations for arXiv:2412.09764."}