{"as_of":"2026-08-16T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43f3a7ef7fa305c469eeca782db5f2e578b258ff4bbf4c163b1975bd24b077f7","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:01:30.719867Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02870/citation-record","integrity":"/paper/2608.02870/integrity","json":"/paper/2608.02870/citation-record.json","paper":"/paper/2608.02870"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-15T15:01:30.613905Z","title":"Mostafa Dehghani, Stephan Gouws, Oriol Vinyals, Jakob Uszkoreit, and Łukasz Kaiser","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.613905Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:0c54bf659efa0773856078c108b0e90088e33ce6935f5fb1ff0421395cf6f66c","observation_id":"4f59f701-4861-4de0-b3f6-70f0f3041635","resolution":{"observed_at":"2026-08-15T15:01:30.613905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-08-13T13:13:21.847890Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-08-15T15:01:30.625051Z","title":"Jonas Geiping, Sean McLeish, Neel Jain, John Kirchenbauer, Siddharth Singh, Brian Bartoldson, Bhavya Kailkhura, Abhinav Bhatele, and Tom Goldstein","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.625051Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:bc295b936d36a7a3985b303ab2a8a604ada5f408bbb1dd021a374c78b2111579","observation_id":"de72fb35-ac2e-4185-ac04-c9f0d8eb0d0c","resolution":{"observed_at":"2026-08-15T15:01:30.625051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-15T20:23:25.637230Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-15T15:01:30.636279Z","title":"David Herel and Tomas Mikolov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.636279Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:2433b351004e527cb59e8c779bb4aa320eb10dd1a26f061e42bd82f27113a6ce","observation_id":"9da5912c-a583-4c44-b0e5-dd063b47eb2f","resolution":{"observed_at":"2026-08-15T15:01:30.636279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08644","last_updated":"2024-05-14T14:21:43Z","snapshot_observed_at":"2026-08-13T00:07:56.864990Z","submitted_at":"2024-05-14T14:21:43Z","title":"Thinking Tokens for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08644","snapshot_observed_at":"2026-08-15T15:01:30.639202Z","title":"Sepp Hochreiter and Jürgen Schmidhuber","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.639202Z"},"links":{"cited_paper":"/paper/2405.08644","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:d87998bd5153c770bd542096b9a7894fb3bc4234b537a01475477abbf83ddc04","observation_id":"6f7d8067-4e3b-4af6-aee8-2462547af96a","resolution":{"observed_at":"2026-08-15T15:01:30.639202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-15T15:01:30.646382Z","title":"Zeyi Huang, Xuehai He, LiLiang Ren, Yiping Wang, Baolin Peng, Hao Cheng, Shuohang Wang, Pengcheng He, Jianfeng Gao, Yong Jae Lee, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.646382Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:52c2f8c30970c5dd25cf11e2f8592f198343bfc45b5db309bd94e3b72d5a9c19","observation_id":"6c73df5d-5d15-4972-ad34-50b0c083db63","resolution":{"observed_at":"2026-08-15T15:01:30.646382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09173","last_updated":"2024-05-07T13:23:46Z","snapshot_observed_at":"2026-08-14T19:04:10.366525Z","submitted_at":"2024-04-14T07:43:45Z","title":"TransformerFAM: Feedback attention is working memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09173","snapshot_observed_at":"2026-08-15T15:01:30.653391Z","title":"Albert Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.653391Z"},"links":{"cited_paper":"/paper/2404.09173","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:a04cc5ab05cb968c2a8298f7580405cf9dca759f99768a85a1188b829ea06907","observation_id":"9ac58093-9fc8-49e6-9cf3-4ab08270bcca","resolution":{"observed_at":"2026-08-15T15:01:30.653391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-15T15:01:30.656511Z","title":"Keller Jordan, Yuchen Jin, Vlado Boza, You Jiacheng, Franz Cesista, Laker Newhouse, and Jeremy Bernstein","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.656511Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:7515e7c568c5910926ffca42a20d93d1aca8d075e5aefe938f8af7c17a797768","observation_id":"5ed3fce0-572c-415a-aa7a-41c4697ae8f1","resolution":{"observed_at":"2026-08-15T15:01:30.656511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06479","last_updated":"2026-07-24T17:49:34Z","snapshot_observed_at":"2026-08-14T18:04:48.986296Z","submitted_at":"2026-06-04T17:57:33Z","title":"Pretraining Recurrent Networks without Recurrence","version":2},"cited_work":{"arxiv_id":"2606.06479","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06479","snapshot_observed_at":"2026-08-15T15:01:30.870699Z","title":"Pretraining Recurrent Networks without Recurrence","venue":"cs.LG","work_id":"a80f341a-bb64-4978-8e59-2afb0bfb2f4d","year":2026},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.663799Z"},"links":{"cited_paper":"/paper/2606.06479","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:0a688f538f78d082d919b4c8205fbd7967ea039baa228a7fe2d68be20ebc1938","observation_id":"711caf1a-7500-461e-85c5-235972947e1a","resolution":{"observed_at":"2026-08-15T15:01:30.876023Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-15T15:01:30.666945Z","title":"Yi Heng Lim, Qi Zhu, Joshua Selfridge, and Muhammad Firmansyah Kasim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.666945Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:34518f6db3cc1a613996b752b4595d94758d9498e335f5710ca31889c7526565","observation_id":"feeafe74-5cad-4363-8c64-7dbc0ca3bab2","resolution":{"observed_at":"2026-08-15T15:01:30.666945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-14T14:41:30.886254Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-08-15T15:01:30.670322Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.670322Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:b15af3d624f28843175ddf44963a7e7ca2dbe9b8f4af94821512320eb5ffba6a","observation_id":"c4fada06-181b-4688-b69f-51a1d5da69a9","resolution":{"observed_at":"2026-08-15T15:01:30.670322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-13T11:33:08.381732Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-08-15T15:01:30.677277Z","title":"9 Tsendsuren Munkhdalai, Manaal Faruqui, and Siddharth Gopal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.677277Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:977a7d6f12b5e247b45b6aba850b844b80d98f721acbd5b36af0c61b50682071","observation_id":"54df791f-ebf7-4863-917b-982ac67c4fc1","resolution":{"observed_at":"2026-08-15T15:01:30.677277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-15T15:01:30.683737Z","title":"Jacob Pfau, William Merrill, and Samuel R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.683737Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:8c6b5edac69d184eac14e96d8c9967db275b9ab01b576fdfc507d9f18a724a18","observation_id":"bcfc7efe-78ad-4ea7-9af3-e1073e92fc10","resolution":{"observed_at":"2026-08-15T15:01:30.683737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15758","last_updated":"2024-04-24T09:30:00Z","snapshot_observed_at":"2026-08-14T08:15:00.691524Z","submitted_at":"2024-04-24T09:30:00Z","title":"Let's Think Dot by Dot: Hidden Computation in Transformer Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15758","snapshot_observed_at":"2026-08-15T15:01:30.686590Z","title":"org/abs/2404.15758","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.686590Z"},"links":{"cited_paper":"/paper/2404.15758","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:1780b27378909cf82731dcf1ff184e4d36259bd56a6b63724a5534f8e8fc050d","observation_id":"a0d96e02-58ab-4e74-9674-8f90677efc0c","resolution":{"observed_at":"2026-08-15T15:01:30.686590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-12T23:45:16.645889Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-15T15:01:30.690224Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.690224Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:e0cb1eaf3a01b147257652c434f85a757b9b48c80bb8c961c64bc71d5b82e281","observation_id":"be21c896-e9cf-48b7-b0fa-3d3235a1e5e0","resolution":{"observed_at":"2026-08-15T15:01:30.690224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:01:31.055895Z","title":"Social IQA: Com- monsense reasoning about social interactions","venue":null,"work_id":"cdde02ae-71f3-4763-bf12-e268bd880162","year":2019},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.693727Z"},"links":{"citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:56ba28f789066c8e64abf7b2a4fbe9f339447f31c108d037a0610a21ac889f45","observation_id":"5c0bc18c-0c8a-4798-83ee-cc47cbdcb894","resolution":{"observed_at":"2026-08-15T15:01:31.059518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-08-13T08:14:01.416880Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-15T15:01:30.699555Z","title":"Yu Sun, Xinhao Li, Karan Dalal, Jiarui Xu, Arjun Vikram, Genghan Zhang, Yann Dubois, Xinlei Chen, Xiaolong Wang, Sanmi Koyejo, Tatsunori Hashimoto, and Carlos Guestrin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.699555Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:6a9c2c5c238a262f01da83c9027d81d806dbd0c09275a33c05a93fc49df118c6","observation_id":"672cb123-d414-4bf3-a10b-d9d999dabc59","resolution":{"observed_at":"2026-08-15T15:01:30.699555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-15T15:01:30.702700Z","title":"Yutao Sun, Li Dong, Shaohan Huang, Shuming Ma, Yuqing Xia, Jilong Xue, Jianyong Wang, and Furu Wei","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.702700Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:609f090e9d55f7857e878c11d2321abecfe3be2565e39b73db7b196f03e09d3b","observation_id":"53b91cb8-d504-4440-aca7-c053350b34bb","resolution":{"observed_at":"2026-08-15T15:01:30.702700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-15T15:01:30.705676Z","title":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.705676Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:7cf5e58a13f6fb217531884c6773d3b5fa258d662cd0896babbfd8cb1c3163d9","observation_id":"d2be326a-72df-42c1-b607-f07243967a40","resolution":{"observed_at":"2026-08-15T15:01:30.705676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-15T19:34:53.217001Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-15T15:01:30.712300Z","title":"Songlin Yang, Jan Kautz, and Ali Hatamizadeh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.712300Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:6d235e54707cc27eaa06de46afd86753b519df8ef7f3b2ecb34ea01b3c7abfc7","observation_id":"51ac58e9-8ac7-4c5b-b503-2fd9c791c989","resolution":{"observed_at":"2026-08-15T15:01:30.712300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-14T21:08:22.323819Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-15T15:01:30.716214Z","title":"Eric Zelikman, Georges Harik, Yijia Shao, Varuna Jayasiri, Nick Haber, and Noah D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.716214Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:f74da12afd5cb0501e01a91c895c2cf5563d9e7b19fa56cba7ee9eb8dad21b68","observation_id":"b20d9658-72c2-4e05-a7be-06bd7a37f96d","resolution":{"observed_at":"2026-08-15T15:01:30.716214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-08-14T11:24:43.688110Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-15T15:01:30.719867Z","title":"Rowan Zellers, Ari Holtzman, Yonatan Bisk, Ali Farhadi, and Yejin Choi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.719867Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:0f70252ed8dc769a1a8ff50f1e03662ec5e369ef157bdfd33f602f454e550566","observation_id":"ff7fc8df-e5f2-4a55-9da8-11314a3df3f9","resolution":{"observed_at":"2026-08-15T15:01:30.719867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-16T05:25:19.960199Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-15T15:01:30.708535Z","title":"10 Yuhuai Wu, Markus N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.708535Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:a841e5299baf196c98ce4522196c384f8e3ff4acf416a0e82cb639111a7786de","observation_id":"4a0bb1d3-11f0-44e3-9a25-28a4d221d10b","resolution":{"observed_at":"2026-08-15T15:01:30.708535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T15:01:30.610290Z","title":"Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.610290Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:c4f7b9afb16131af463f0c669a5394d3e0d399895e1030a84871d05af4aa7016","observation_id":"35b78c96-13c8-4aa8-a96f-584dc95e877c","resolution":{"observed_at":"2026-08-15T15:01:30.610290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-15T15:01:30.597016Z","title":"Yonatan Bisk, Rowan Zellers, Ronan Le Bras, Jianfeng Gao, and Yejin Choi","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.597016Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:fca310964a46d5a443f9cce028b3e93a1aea036ea8b4707496b73e17970ed97c","observation_id":"bde4125c-a480-4c02-a159-9c1215f81116","resolution":{"observed_at":"2026-08-15T15:01:30.597016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09402","last_updated":"2021-01-25T13:12:00Z","snapshot_observed_at":"2026-08-07T09:29:41.147848Z","submitted_at":"2020-02-21T16:37:57Z","title":"Addressing Some Limitations of Transformers with Feedback Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09402","snapshot_observed_at":"2026-08-15T15:01:30.621873Z","title":"Daniel Y","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.621873Z"},"links":{"cited_paper":"/paper/2002.09402","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:35b8927e099ba90914db7e8fb57219388328effb17dcab251bffde211fd229f5","observation_id":"36103b3e-0959-4946-aa7f-37bfa524a16e","resolution":{"observed_at":"2026-08-15T15:01:30.621873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-15T15:01:30.628960Z","title":"Albert Gu, Karan Goel, and Christopher Ré","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.628960Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:103e82db91009d15fc331e723b69dbe550b7bddb8050ddf1045e9e31c93c7f78","observation_id":"f7aeb311-7693-4134-bfd0-60d71e4776d4","resolution":{"observed_at":"2026-08-15T15:01:30.628960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-15T15:01:30.593199Z","title":"Iz Beltagy, Matthew E","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.593199Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:14bb18943715e03c7f035a33d509f61fbdf39e8ca60ad407b66797a48825a7e6","observation_id":"e25266e1-9245-4037-9dda-bae583e7fce7","resolution":{"observed_at":"2026-08-15T15:01:30.593199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:01:30.603253Z","title":"Christopher Clark, Kenton Lee, Ming-Wei Chang, Tom Kwiatkowski, Michael Collins, and Kristina Toutanova","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T15:01:30.603253Z"},"links":{"citing_paper":"/paper/2608.02870"},"observation_digest":"sha256:ab52975fa9622e9a2a69e69676401067ae0dbf5d8d05e143ea3bc73aaaa6f6a9","observation_id":"680ed62a-51d5-474b-8af2-bbbb3d7e1e2a","resolution":{"observed_at":"2026-08-15T15:01:30.603253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02870","last_updated":"2026-08-05T16:58:35Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T14:54:46.938680Z","submitted_at":"2026-08-03T20:40:49Z","title":"Maglev: Sliding Recurrent Memory"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2608.02870."}