{"as_of":"2026-08-08T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afcc22fd6b156415dbc32419b33f0da18c8e5803804e41a88a973e8025bae80a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:07:18.588999Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27919/citation-record","integrity":"/paper/2607.27919/integrity","json":"/paper/2607.27919/citation-record.json","paper":"/paper/2607.27919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.237143Z","title":null,"venue":null,"work_id":null,"year":2034},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.237143Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:844a11e81419d598d2df99496eff7543e8ca440fb0d972b8a44f0e1bd9b5efa1","observation_id":"f3335169-b4d0-4f8c-928d-071e91f185e7","resolution":{"observed_at":"2026-07-31T23:07:18.237143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.326633Z","title":"Output: number EC4.3.3","venue":null,"work_id":null,"year":1913},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.326633Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:69f9f4631e57f60c1fba6ed20f67844b7b74650158d786b94497c806a3ce6d14","observation_id":"f33655f4-5c94-4c79-b548-75e8df3eceb1","resolution":{"observed_at":"2026-07-31T23:07:18.326633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-07-31T23:07:18.027807Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.027807Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:78276df7420b10fc3b292020500729d3ef1900a781db2bb02a7bf0d84037f25c","observation_id":"afc6430e-0aa1-4efd-8cfb-60f769502f09","resolution":{"observed_at":"2026-07-31T23:07:18.027807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.222219Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.222219Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:e35594327cc8690596b7fd7847ac60005280d8f75d3aac69c76b4708d8376649","observation_id":"d6e2000b-bdf5-45a0-a693-8ab7eeb68f05","resolution":{"observed_at":"2026-07-31T23:07:18.222219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.040894Z","title":"Biology-instructions: A dataset and benchmark for multi-omics sequence understanding capability of large language models.arXiv preprint arXiv:2412.19191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.040894Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:bf95b6c9ca71413694aa4abd0387959a2247e3117aec6134274475a56daeaf29","observation_id":"d1783bd4-9bb7-4f53-8616-0f3f9c253f4a","resolution":{"observed_at":"2026-07-31T23:07:18.040894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-31T23:07:18.044920Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.044920Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:4415c306518b3700d5360aaddc3e08f3fab9ed6d02c9d4aec805305c5b4072e0","observation_id":"341b64aa-0496-43df-82d8-94047934b1e7","resolution":{"observed_at":"2026-07-31T23:07:18.044920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00172","last_updated":"2020-02-15T01:04:52Z","snapshot_observed_at":"2026-07-06T08:33:58.970043Z","submitted_at":"2019-11-01T01:09:53Z","title":"Generalization through Memorization: Nearest Neighbor Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00172","snapshot_observed_at":"2026-07-31T23:07:18.054189Z","title":"Generalization through memorization: Nearest neighbor language models.arXiv preprint arXiv:1911.00172,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.054189Z"},"links":{"cited_paper":"/paper/1911.00172","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:4f9ab2aba502cee056fa24a8fee075f72c9856e1a621410c6b25c5b0a0c1019c","observation_id":"423d9f94-45d4-4634-9169-fa4252f912f6","resolution":{"observed_at":"2026-07-31T23:07:18.054189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.058658Z","title":"Halueval: A large-scale halluci- nation evaluation benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.058658Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:2ca4fa136c43fc14b580436a72b7128bd44d17548fd0b688739fc6800da66510","observation_id":"96cf3753-c46c-465d-90c0-498e0e1d7dc1","resolution":{"observed_at":"2026-07-31T23:07:18.058658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-07-31T23:07:18.062768Z","title":"Logiqa: A challenge datasetformachinereadingcomprehensionwithlogicalreasoning.arXivpreprintarXiv:2007.08124,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.062768Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:7df2d799690de7c780c14f25cafb71c8283483ecc980cbb19df500cec348f8c2","observation_id":"2cbe41f1-994d-42c5-b755-0e9569b9af4b","resolution":{"observed_at":"2026-07-31T23:07:18.062768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-31T23:07:18.066706Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.066706Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:12f3c891999b4196a028a16b2a07623bbd688273bcbf142645bc77d41c888fa5","observation_id":"d7db37db-285e-4641-9eec-daa7e2f97f4d","resolution":{"observed_at":"2026-07-31T23:07:18.066706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-07-31T23:07:18.075283Z","title":"Olmo 3.arXiv preprint arXiv:2512.13961,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.075283Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:389c072ace06792e58ff9331c8aecefe4981ad14fc069015b0d8df186c9812ec","observation_id":"378ba405-6464-41b8-8757-824308aa3560","resolution":{"observed_at":"2026-07-31T23:07:18.075283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-31T23:07:18.083883Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.083883Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:bafd136272183a365423715f17e55655e61e4629962ec739ac1f6ccc7f605610","observation_id":"35be0422-3129-40e8-b6c8-dfae8f463175","resolution":{"observed_at":"2026-07-31T23:07:18.083883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-31T23:07:18.092517Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.092517Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:b29a2955b0d1d38ded63526a9b86b108f9c7e4ef38c9f4b2f771c4f4f32781d1","observation_id":"b7d365a7-83a0-4e9a-b5c0-426545b4631a","resolution":{"observed_at":"2026-07-31T23:07:18.092517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.096594Z","title":"Memoryandbrainsystems: 1969–2009.JournalofNeuroscience,29(41):12711–12716,","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.096594Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:073dceb03b32473a952c36c391785446eb3fe43d8586233d36657457e00ab53a","observation_id":"11195077-0009-4f00-bf43-05f7944218fb","resolution":{"observed_at":"2026-07-31T23:07:18.096594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-07-31T23:07:18.100553Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.100553Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:b331d8d44735a39fcc56577002895b0b11b74c4e15008713442819eb706c7dd8","observation_id":"52a03c36-fd7e-4d10-b040-e977c38cc231","resolution":{"observed_at":"2026-07-31T23:07:18.100553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.108314Z","title":"Infllm: Training-free long-context extrapolation for llms with an efficient context memory.Advances in neural information processing systems, 37:119638–119661, 2024a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.108314Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:79b5ce69413ff5a5f9c599bf0bd240cb2e1f3c5e6a99229ba0d3ceb91e76be7d","observation_id":"e5e3f4c1-ba32-4d5f-bf23-320064905b76","resolution":{"observed_at":"2026-07-31T23:07:18.108314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.116807Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.116807Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:5c356d663bebd136c0547cd6c8b19aff37d267ec70d82a6754e6a6aab6e13d85","observation_id":"22eb6e8b-7c22-4202-af09-2c36777c9400","resolution":{"observed_at":"2026-07-31T23:07:18.116807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.121587Z","title":"Vismem: Latent vision memory unlocks potential of vision-language models.arXiv preprint arXiv:2511.11007,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.121587Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:fe082faee4cd125c14465df5071d1eae7ef4c8aa534e0fd04f047c16e5555363","observation_id":"b15debcf-38a5-438b-8e56-588ce5b5a5b0","resolution":{"observed_at":"2026-07-31T23:07:18.121587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11325","last_updated":"2023-09-23T18:36:21Z","snapshot_observed_at":"2026-07-06T16:21:17.180009Z","submitted_at":"2023-09-20T13:50:26Z","title":"DISC-LawLLM: Fine-tuning Large Language Models for Intelligent Legal Services","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11325","snapshot_observed_at":"2026-07-31T23:07:18.133745Z","title":"Disc-lawllm: Fine-tuning large language models for intelligent legal services.arXiv preprint arXiv:2309.11325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.133745Z"},"links":{"cited_paper":"/paper/2309.11325","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:da5adad1b617ec3e7e34b0f2b0154a44b88cbe235ef7f0c7c2a01b22b657fde0","observation_id":"83b901b2-45f7-4d04-86cf-772714be97c9","resolution":{"observed_at":"2026-07-31T23:07:18.133745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-31T23:07:18.155008Z","title":"Glm-5: from vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.155008Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:4e5238b4652e8cdceeec058e911a775e16811a189d9fd846569592063bfec334","observation_id":"ca6e958a-2c2b-4beb-9635-29baa4eaf2c9","resolution":{"observed_at":"2026-07-31T23:07:18.155008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-31T23:07:18.172943Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.172943Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:e96be4ba15bb1a030d147cd0f5e3dc95ac4d51cc328d5d8bb00b85c4236cf9a3","observation_id":"f558500c-4181-4514-a2d8-e928c771ae81","resolution":{"observed_at":"2026-07-31T23:07:18.172943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.193327Z","title":"Pre-training limited memory language models with internal and external knowledge.arXiv preprint arXiv:2505.15962,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.193327Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:a0d90d2a7287362e65c316420bc3fbcaca86d5636dad8ede5d9ace2cbda47b8e","observation_id":"7c458226-6e37-426a-a863-7f406850b22b","resolution":{"observed_at":"2026-07-31T23:07:18.193327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.205826Z","title":"Training language models with memory augmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.205826Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:bd9344f9dda8bde0c7fd7ff3cda0a15be30f6287ee644c5f5c8ce9fbf3f6b131","observation_id":"a7dc31d8-0c1c-406d-b7ab-0beee8b9ef3c","resolution":{"observed_at":"2026-07-31T23:07:18.205826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.255922Z","title":"Table 14| Top-3 versus top-5 retrieval for the RAG baseline","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.255922Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:307049bc8ec02291562b6ed30257a22ab8bfc712b5c2bd1853dfc976ab5a77e7","observation_id":"265d62b5-671d-4aa4-9d89-ae5fe79bebb8","resolution":{"observed_at":"2026-07-31T23:07:18.255922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.276958Z","title":"Zaheer Khan, Yuvraj Singh and Marlon Samuels made their ODI debuts during the competition","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.276958Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:72f06e801da859e4c3c3111a80aaa865c7af09011e021043b7b24b3dc94ed4b6","observation_id":"0b08c9d3-ac7e-4057-92d5-8fba4e260753","resolution":{"observed_at":"2026-07-31T23:07:18.276958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.434809Z","title":"BioInst Table 21|Per-task domain memory results on BioInst for the Qwen3-0.6B-Base backbone","venue":null,"work_id":null,"year":1918},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.434809Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:6c7c26a1f7ff84e56b794a40fb83610984c6d580204ac7183b0446c003ef9665","observation_id":"f28af8c7-e7f6-48a4-a693-a5666f186495","resolution":{"observed_at":"2026-07-31T23:07:18.434809Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.588999Z","title":"AVG is the macro average over the 25 task scores","venue":null,"work_id":null,"year":2065},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.588999Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:3d648379b2b32424c5ccaac0b50b147435ebd2f736c0fdc265c55e943a1394d2","observation_id":"f33e5e3d-d57a-4d2d-8148-3737ab225eb3","resolution":{"observed_at":"2026-07-31T23:07:18.588999Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.023589Z","title":"Lawbench: Benchmarking legal knowledge of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":381,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.023589Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:c17884e9b09694a784bec589847e9753d2de781e812d16d705a499d7b6724c95","observation_id":"cb505e47-680a-46a1-9f1c-d4656644d17e","resolution":{"observed_at":"2026-07-31T23:07:18.023589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1000381","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://doi.org/10.1371/journal.pcbi.100","venue":"PLoS Computational Biology","work_id":"02aeaf08-6b3b-46d4-a68b-8c4777eff381","year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.018810Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:1bd03743f89468e391f6fa514b31067059244de0b45b6ba160654dbceff3bf94","observation_id":"8b294cf3-c5d9-4b6b-9a7b-252e767cc263","resolution":{"observed_at":"2026-07-31T23:11:01.454730Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.300997Z","title":"Gimme Shelter","venue":null,"work_id":null,"year":1916},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.300997Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:5bceda841577b1455c31706f88aa958183c76accad8367addf6e250a0a2ad527","observation_id":"750f4510-084a-45a0-b847-f0ab59c62d15","resolution":{"observed_at":"2026-07-31T23:07:18.300997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.032647Z","title":"Deepsieve: Information sieving via llm-as-a-knowledge-router","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.032647Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:45c083cfefb56587d6775459f1d1521a01e8fdab41be7ebc9dc8292721d1813c","observation_id":"6f7cf464-a07f-4cb2-afde-046a4380e2c0","resolution":{"observed_at":"2026-07-31T23:07:18.032647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.104442Z","title":"Mlp mem- ory: A retriever-pretrained memory for large language models.arXiv preprint arXiv:2508.01832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.104442Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:5cb3efd20ad13a12f7e55f5f502d71f1c7d5d14e8c24e91b4ad6fd0ebc1c79cd","observation_id":"10935bf2-8bd0-4765-8873-8ba4feda3d39","resolution":{"observed_at":"2026-07-31T23:07:18.104442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.080021Z","title":"Measuring and narrowing the compositionality gap in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.080021Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:736ef296ac216e9fa2017ca760febc96a35cabc258e5fefe0e1976c94f97680c","observation_id":"0f687444-f0ab-4b86-b9a6-2b67db7e77ae","resolution":{"observed_at":"2026-07-31T23:07:18.080021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.049255Z","title":"Demystifying domain- adaptive post-training for financial llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.049255Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:6b302d791ae459a8cd1675678945b4270fe61fd24ce3ed87e77cddb292f80a48","observation_id":"c13c17a5-33fd-4537-9958-6f3cf84b708a","resolution":{"observed_at":"2026-07-31T23:07:18.049255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-07-31T23:07:18.005372Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context.arXiv preprint arXiv:1901.02860,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.005372Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:fd74563033a07d872bd49aebc8458f494c0e1f568fcd0953ad54f690254ff18f","observation_id":"9ded397c-b5b0-4595-8dd4-ce7610ec1ad0","resolution":{"observed_at":"2026-07-31T23:07:18.005372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-07-31T23:07:18.010236Z","title":"Longrope: Extending llm context window beyond 2 million tokens.arXiv preprint arXiv:2402.13753,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.010236Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:8f85fa12783a02d8b53387b5ec624b711c89f760bd87b58578a70071b89185c5","observation_id":"0825969d-43f8-4d20-bd03-8d857dd9c58e","resolution":{"observed_at":"2026-07-31T23:07:18.010236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.036737Z","title":"Measuring memorization in language models via probabilistic extraction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.036737Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:5c7f2e926d69b1ffa25c952db42578c51ac6b3805849adf6243667df111d7782","observation_id":"049b80c2-e55b-45a9-86c7-d377d65bc0c6","resolution":{"observed_at":"2026-07-31T23:07:18.036737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-31T23:07:18.088076Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.088076Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:abf4f87c2518f9563db8feff50623436bb4d7161a058b714afbf99402941fbe6","observation_id":"c8d0ba66-3540-460f-a7d9-5e957dc98f8a","resolution":{"observed_at":"2026-07-31T23:07:18.088076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-31T23:07:18.000927Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.000927Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:2e63bc9002fcdf43553261ac512982e3e892baafb6085cb53403eab532f0b786","observation_id":"6ea5ff70-16ff-4f12-88f1-714f37dbe741","resolution":{"observed_at":"2026-07-31T23:07:18.000927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-07-31T23:07:18.071026Z","title":"2 olmo 2 furious.arXiv preprint arXiv:2501.00656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.071026Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:def9da5580ec2477b7cbcbb1c972918910bdb566b3a0e519d5e81f56c8749347","observation_id":"4b3af424-dd33-4748-91ab-817261791c7a","resolution":{"observed_at":"2026-07-31T23:07:18.071026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-07-31T23:07:17.996097Z","title":"Yoshua Bengio, Réjean Ducharme, Pascal Vincent, and Christian Jauvin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:17.996097Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:aa101c7ca17019538ddac804f53fbecaf8cac49947ca9387f23e163158fcaa95","observation_id":"f26b7e36-ce8a-4fed-8507-96f858ff369a","resolution":{"observed_at":"2026-07-31T23:07:17.996097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.014654Z","title":"Twinvoice: A multi-dimensional benchmark towards digital twins via llm persona simulation.arXiv preprint arXiv:2510.25536,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.014654Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:849b31ad16455458f9f2f7c98deaeb0d23db4a12883e1610b4925e52e25ba96c","observation_id":"f5233451-7b0a-4c15-871a-32b219e719f7","resolution":{"observed_at":"2026-07-31T23:07:18.014654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T23:07:18.112592Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.112592Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:1af5fc3d6a7055ad378fb9201d09d8a5d66fb1a21b18a89eebc1fde5dc3ef3f9","observation_id":"e4e18648-9f16-4944-b8bc-3051f0351567","resolution":{"observed_at":"2026-07-31T23:07:18.112592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T23:46:38.246023Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.27919."}