{"as_of":"2026-08-07T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30f6e36c0adf81bed25c38708aa54eb0b031cb5c5393b5845ff0bacc4c57acaf","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T14:50:03.831572Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09889/citation-record","integrity":"/paper/2607.09889/integrity","json":"/paper/2607.09889/citation-record.json","paper":"/paper/2607.09889"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":null,"venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:9b47a1c06b8d7bd6ab39f5556249751defdc5c05247b7e3a81100c281b60e429","observation_id":"273c3177-3354-4964-9c61-b34660140a30","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"Arora, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:2246623ce13d454ddddd6e09a3832e8e514b87ae15fcaf7e2c8cff5b191444e5","observation_id":"3d915ebb-4362-45eb-af84-8ec958cf11c8","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-05T07:11:50.808005Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Beal et al.(2002)] M","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:36a427b28c8a65575a3798de88fb57c2f546d25169e452cb7ea8ff2a017ab246","observation_id":"f90c6638-5179-4c02-978c-32e3abeef210","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"Behrouz, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:d7e381e1fe00124824dd3af1785a5d4e92cfd292ddce789251c8c56a95688c5b","observation_id":"a6249669-c6a7-430b-b25a-7e71c35a2e9f","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Du & Li(2016)] M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:47962933544bc8c4979b13b582df294430f6b6fdfe2ddda2cb066e4c1cc66636","observation_id":"a17c5467-00a2-468d-8827-c14f56b185a2","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"Fountas et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:11f03f6ec2c9d53731ce2d91e7f7c5cb2ae5756d7a7edb89d8727577719e0c5c","observation_id":"036e1eb1-6814-4678-93cf-68b4fa8f6037","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Fox et al.(2011)] E","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:827fc18e87892cf3622af383c3caa9466d8b0f646e44bba07bfbc8078ddf3913","observation_id":"c0e7a67f-1c1c-4a8c-b4ea-2d3d820a8644","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"Geadah, International Brain Laboratory, and J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:1a6007fe2c3eeca3238f273cf65e20d8c5a8935c08359cf311ea53b379259124","observation_id":"a0a3bc20-69bd-4276-b328-882b18e8085b","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Gu et al.(2022b)] A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:d7e8ed38e586bacc7a71b22bee37d9beb95fd419e56321f59c956f0f2fae0557","observation_id":"997f61f0-e43f-4e25-92d9-8c5f02504569","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11893","last_updated":"2022-08-05T17:02:29Z","snapshot_observed_at":"2026-07-06T13:24:06.368922Z","submitted_at":"2022-06-23T17:58:39Z","title":"On the Parameterization and Initialization of Diagonal State Space Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11893","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Gu & Dao(2023)] A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2206.11893","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:1062800bd70f4928ed7d493b617b044d33fc62d2230b26da911f86f3165e0afa","observation_id":"eb9750c7-3e0d-4fc7-839b-8fdb8b61542a","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[He et al.(2017)] P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:be3c0ea98378ae0c4baaa8dffcad9c552bdec7f546970483a25eb864623e494f","observation_id":"d12b49ab-f4bf-4306-b58b-bc3e72092e6e","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"Jelassi, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:c20278e52231bc33ec5ad5b069514ad0553b460f946c5a4354120a5143928e50","observation_id":"4353c6b2-04a3-4213-9ed1-ecce400046d3","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Khandelwal et al.(2020)] U","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:673f0a636d0840c68690490db0fe4595b31b7b47ccc36813c98282959aa51a57","observation_id":"c975545d-840b-4086-ad3b-027c90be10fd","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00172","last_updated":"2020-02-15T01:04:52Z","snapshot_observed_at":"2026-07-06T08:33:58.970043Z","submitted_at":"2019-11-01T01:09:53Z","title":"Generalization through Memorization: Nearest Neighbor Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00172","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Kitaev et al.(2020)] N","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/1911.00172","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:52778d07ff30e827fd1238ce5ef83b30c23dfafec98d0ccc97ae833d789f3ece","observation_id":"6d1a8949-b44b-46a5-ae42-42917b281c33","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Kulis & Jordan(2012)] B","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:66e7bfb9866303f3e08ec56180653b06e838f6833b5bb1a73321fb4371a50d1e","observation_id":"1734692f-9e88-48d6-adee-02b692663cda","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1111.0352","last_updated":"2012-06-14T15:05:55Z","snapshot_observed_at":"2026-07-06T02:36:49.729256Z","submitted_at":"2011-11-02T00:09:18Z","title":"Revisiting k-means: New Algorithms via Bayesian Nonparametrics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1111.0352","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Lample et al.(2019)] G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/1111.0352","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:c4c34abf09eeb227c08d0010614efccb77a9cf3ddf049c5bdecd21068002f9ec","observation_id":"29285f49-c0bd-479d-b217-f92f9c13e7e7","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05242","last_updated":"2019-12-16T03:46:57Z","snapshot_observed_at":"2026-08-01T18:15:17.193138Z","submitted_at":"2019-07-10T14:52:12Z","title":"Large Memory Layers with Product Keys","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05242","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Li et al.(2024)] Y","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/1907.05242","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:ca47420f2cdc27316ccb6321316ddf1e46fc7015eaee1e62055d0c73ee9ca950","observation_id":"35162da6-2bab-4646-b1b4-0ef5f375c81c","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Martins et al.(2022)] P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:4640d67bbab746e710e10db5c6f5e83144d2a7817cb4056be30a12e2d48d140e","observation_id":"c925ead3-2f7e-448c-bcdb-51d6eb2cd35a","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00301","last_updated":"2022-03-25T10:37:54Z","snapshot_observed_at":"2026-07-06T11:43:22.019207Z","submitted_at":"2021-09-01T10:51:58Z","title":"$\\infty$-former: Infinite Memory Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00301","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Mohtashami & Jaggi(2023)] A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2109.00301","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:c9b7dbb96bea1fc4d408faf1a26c77c8d441d69d8143dc0051bfc63805898997","observation_id":"331a404b-77f1-46fd-8c9c-97c8eafa34b9","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-04T15:01:39.394740Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Pritzel et al.(2017)] A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:34becf3143c9cf9a32722c837dd580a1db715fa311adb098ed3a65a572acc855","observation_id":"5a4ae200-fd8e-4181-9eec-17bf7c02eb47","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01988","last_updated":"2017-03-06T17:23:27Z","snapshot_observed_at":"2026-07-06T05:32:33.106717Z","submitted_at":"2017-03-06T17:23:27Z","title":"Neural Episodic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01988","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Ramsauer et al.(2021)] H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/1703.01988","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:18dfb144cf3e6b163c55d51fb3b6552f73a680070412d1595baf6f10c1c60bbe","observation_id":"036565f9-ff46-4351-b244-3b5f38680f4d","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02217","last_updated":"2021-04-28T07:24:49Z","snapshot_observed_at":"2026-08-05T15:08:02.538782Z","submitted_at":"2020-07-16T17:52:37Z","title":"Hopfield Networks is All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02217","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Roy et al.(2021)] A","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2008.02217","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:f00f4129a340a6a8a0808f13958e2be8c37ce95ddb9196e7e2d3c7b3a87fc88a","observation_id":"d6a8f102-ce83-4b18-96ea-ccd7c232280e","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.05997","last_updated":"2020-10-24T19:41:17Z","snapshot_observed_at":"2026-08-04T10:51:49.042823Z","submitted_at":"2020-03-12T19:50:14Z","title":"Efficient Content-Based Sparse Attention with Routing Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.05997","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Teh et al.(2006)] Y","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2003.05997","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:8921327926b464babea4696acd1ded555c6b0900d956d62c1090ce3ecbd826be","observation_id":"6b6f5401-5fb3-4b33-9ff4-d87bb92c3783","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:7d3a4abdba36f4e56b877c9db5334c45b24aed89b2c033b846cb4615c903c51b","observation_id":"80f5f7aa-598b-4b75-b996-586c1223149f","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04825","last_updated":"2020-09-29T20:18:43Z","snapshot_observed_at":"2026-08-05T05:38:19.436135Z","submitted_at":"2020-07-09T14:17:50Z","title":"Fast Transformers with Clustered Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04825","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Wu et al.(2018)] Y","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2007.04825","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:421398ea680a1a938af973ed9244db82d592f95b36d11948aaeb23a054925891","observation_id":"f949d955-b59d-4a1d-8295-fa809c923be4","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01756","last_updated":"2018-06-18T09:52:40Z","snapshot_observed_at":"2026-07-06T06:31:52.377419Z","submitted_at":"2018-04-05T10:07:05Z","title":"The Kanerva Machine: A Generative Distributed Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.01756","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Wu et al.(2022)] Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/1804.01756","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:6e687747b5887d2fc1f6f368a066a37d4e4e2d6fac1d728196fc4a99294912aa","observation_id":"06d30fa8-9cde-43ef-bcc3-c65e7669e551","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Xiao et al.(2024)] G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:4d33f3c8013bf909dc7977a670f192ba6beecac0a39ef69a920fafcea5799916","observation_id":"b1876493-7afc-479b-bd98-11881ec25a72","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"15 [Zhang et al.(2023)] Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:c2f6c502652c17123abe4020459819c179dd620176e4a5acd9467f4b3af51575","observation_id":"00801938-4316-4a39-9bba-6a96ba9e5930","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:7d9ebae1779dc1d2d210c12af1e89d6286de585480f827958659b6433cfca102","observation_id":"0ad4a6c5-85d4-4cb3-8215-f8d4301d8a90","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.09889."}