{"as_of":"2026-08-19T09:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9195ff938b351d6415339fc7f9241dc17592f8cf730b7d79c176bf1e8eec433","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:44:01.819934Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:22:02.595935Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T00:22:02.788402Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"cited_work":{"arxiv_id":"2607.25357","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.25357","snapshot_observed_at":"2026-08-16T00:22:02.788402Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","venue":"cs.LG","work_id":"e30de30f-36ed-4643-8621-47bb2bf0aacf","year":2026},"citing_paper":{"arxiv_id":"2608.12435","last_updated":"2026-08-12T13:45:01Z","snapshot_observed_at":"2026-08-19T08:03:14.666975Z","submitted_at":"2026-08-12T13:45:01Z","title":"MARCH: Scaling Recurrent Memory with Content-Routed State Anchors","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:02.595935Z"},"links":{"cited_paper":"/paper/2607.25357","citing_paper":"/paper/2608.12435"},"observation_digest":"sha256:a8c4b85c6cba8e1fc20d38bfe722bb17e9ddf4ae4ac49564f03b5110f8fe5457","observation_id":"b9fb66c5-1395-4f65-9c33-ce51a60c8852","resolution":{"observed_at":"2026-08-16T00:22:02.793982Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.25357/citation-record","integrity":"/paper/2607.25357/integrity","json":"/paper/2607.25357/citation-record.json","paper":"/paper/2607.25357"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:00.686856Z","title":"Yonatan Bisk, Rowan Zellers, Ronan Le Bras, Jianfeng Gao, and Yejin Choi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.686856Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:a5f31edffc0e6af33f052a27ff3d2558716dfc86127f0eda6aace5bd5c9c5d14","observation_id":"e80b4544-3a6f-4d29-98c5-ac6e72e09e90","resolution":{"observed_at":"2026-08-01T02:44:00.686856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-01T02:44:00.905392Z","title":"Yingfa Chen, Xinrong Zhang, Shengding Hu, Xu Han, Zhiyuan Liu, and Maosong Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.905392Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:47a22350a73f3041717a6c56446c4e19e5722652ae4adc13b7a53a75750ee69f","observation_id":"aaf4977e-4344-4fc2-b8ce-7d5da3d9a12d","resolution":{"observed_at":"2026-08-01T02:44:00.905392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.066325Z","title":"Mom: Linear sequence modeling with mixture-of-memories","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.066325Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:a2b8cb0e009ce97023714838a89543be50e8a0a846148ba6b9a9b65beb10f141","observation_id":"c4feb35b-3e90-470e-8c7b-c062a0d79aa2","resolution":{"observed_at":"2026-08-01T02:44:01.066325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T02:44:01.103367Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.103367Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:bcdf2875bb824db5163c7a67a2a295e9d3da1d5f66290b441b2ddd44de582368","observation_id":"849ac18a-ee82-4d40-9a81-107c7bc56f75","resolution":{"observed_at":"2026-08-01T02:44:01.103367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-16T14:22:19.962526Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-01T02:44:01.258380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.258380Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:44ac90971c87d9e0747acce501aeaaa9ea790a44f8d48fb8489b1f2539b77e8e","observation_id":"653d6092-2031-4eaf-9b84-61e86a5c15f9","resolution":{"observed_at":"2026-08-01T02:44:01.258380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.292750Z","title":"Peng Jin, Bo Zhu, Li Yuan, and Shuicheng Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.292750Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:1dd1f1e55a5d5a070d485b5f26e0c42d2ac1b9b5a6fad74da6af1cc3595b574a","observation_id":"00cf7537-debd-4d4e-bf4c-fdaa7ab8e210","resolution":{"observed_at":"2026-08-01T02:44:01.292750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02130","last_updated":"2025-03-31T19:41:52Z","snapshot_observed_at":"2026-08-16T12:53:24.811443Z","submitted_at":"2025-03-03T23:35:23Z","title":"Forgetting Transformer: Softmax Attention with a Forget Gate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02130","snapshot_observed_at":"2026-08-01T02:44:01.453174Z","title":"Forgetting transformer: Softmax attention with a forget gate.arXiv preprint arXiv:2503.02130,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.453174Z"},"links":{"cited_paper":"/paper/2503.02130","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:83257fb6bfc87151bda8239c84b0f3acd62b507163fc308fe94fe9a8ee10041d","observation_id":"f8b427f3-4cd4-4da9-acd9-720214a8eb06","resolution":{"observed_at":"2026-08-01T02:44:01.453174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T02:44:01.506001Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.506001Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:6ad7e8fd87e0046c706e5609d01cb4abf8c1cf2383bae4577c56f538f69552ef","observation_id":"a7c98af6-1196-4443-91a6-c02069b7e178","resolution":{"observed_at":"2026-08-01T02:44:01.506001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.536563Z","title":"William Merrill, Jackson Petty, and Ashish Sabharwal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.536563Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:1a19b59dafb224781d451ffbf8c46520e420619234c45ac23cfdf7b8b7526c7e","observation_id":"6eb66fed-bbc8-4f17-9df1-55159d5a73ac","resolution":{"observed_at":"2026-08-01T02:44:01.536563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-17T21:55:20.885060Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-08-01T02:44:01.559402Z","title":"Landmark attention: Random-access infinite context length for transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.559402Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:221c9c278987c9b6923091e744ac0fbb0fbcd0739f4f1c718f9a648047bdcdd5","observation_id":"a91589a0-0cb5-496e-a9a5-dab08c43a27a","resolution":{"observed_at":"2026-08-01T02:44:01.559402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17388","last_updated":"2026-06-23T17:12:17Z","snapshot_observed_at":"2026-08-15T03:11:50.414827Z","submitted_at":"2025-11-21T16:50:00Z","title":"Selective Rotary Position Embedding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17388","snapshot_observed_at":"2026-08-01T02:44:01.616412Z","title":"Selective rotary position embedding.arXiv preprint arXiv:2511.17388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.616412Z"},"links":{"cited_paper":"/paper/2511.17388","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:4151e7f28e309e36507677c810791181a52948e72d3a5460ca7b93af1355edbd","observation_id":"9f38db78-4112-4975-b3fa-cf65f25edc25","resolution":{"observed_at":"2026-08-01T02:44:01.616412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20339","last_updated":"2025-02-27T18:08:16Z","snapshot_observed_at":"2026-08-17T15:28:30.798645Z","submitted_at":"2025-02-27T18:08:16Z","title":"Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20339","snapshot_observed_at":"2026-08-01T02:44:01.671659Z","title":"Yuqi Pan, Yongqi An, Zheng Li, Yuhong Chou, Ruijie Zhu, Xiaohui Wang, Mingxuan Wang, Jinqiao Wang, and Guoqi Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.671659Z"},"links":{"cited_paper":"/paper/2502.20339","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:f1c32a144599372b50e1e74427142f30152300e0ccd08f66d23fd2631a5a12db","observation_id":"af096754-c3b6-4507-be41-b5f893d81905","resolution":{"observed_at":"2026-08-01T02:44:01.671659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04248","last_updated":"2024-04-25T17:01:52Z","snapshot_observed_at":"2026-08-16T14:20:53.387690Z","submitted_at":"2024-02-06T18:56:35Z","title":"Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04248","snapshot_observed_at":"2026-08-01T02:44:01.725636Z","title":"20 Bowen Peng, Jeffrey Quesnelle, Honglu Fan, and Enrico Shippole","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.725636Z"},"links":{"cited_paper":"/paper/2402.04248","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:e7cd8d0a4cfcb898b99f76143814f06998c25e1add8d313f6664577b9327cccb","observation_id":"942426ea-3dea-4c5e-a077-692e01c6c2eb","resolution":{"observed_at":"2026-08-01T02:44:01.725636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02488","last_updated":"2022-06-01T23:58:25Z","snapshot_observed_at":"2026-08-16T17:51:34.702381Z","submitted_at":"2021-10-06T03:53:25Z","title":"ABC: Attention with Bounded-memory Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02488","snapshot_observed_at":"2026-08-01T02:44:01.745380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.745380Z"},"links":{"cited_paper":"/paper/2110.02488","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:f70e9ac021c419eabb231080ba2ca5c4d0d2257462cdcbd5b1a5b9b4afad8c13","observation_id":"16d6f1d8-30e6-4ae8-bb4c-af7a00612e5f","resolution":{"observed_at":"2026-08-01T02:44:01.745380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-01T02:44:01.748866Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.748866Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:2b8841991067a54322ae77b62e2fc4f47ead9c35b30d6b5672cebc81b8541479","observation_id":"f1860f79-3f7b-4f76-8888-93b9a2ee32e2","resolution":{"observed_at":"2026-08-01T02:44:01.748866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-14T19:05:25.482398Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-01T02:44:01.752057Z","title":"Pranav Rajpurkar, Robin Jia, and Percy Liang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.752057Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:50e33fe4aa6a99244bded2393a3f0ac398e7c551926e8247ce4c2584120cec26","observation_id":"71aa1d7b-129d-41b4-bcc6-a5ea14786201","resolution":{"observed_at":"2026-08-01T02:44:01.752057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-16T13:44:03.977685Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-01T02:44:01.755790Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling, 2024.URL https://arxiv.org/abs/2406.07522, 2406:07522,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.755790Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:9ed28a6e16b762d58197baae269af4b239f16f517ac57f32b5b2fb728c7773e7","observation_id":"18b80eac-9684-4ca0-9f12-32c618fa7063","resolution":{"observed_at":"2026-08-01T02:44:01.755790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.759166Z","title":"Understanding and improving length generalization in recurrent models.arXiv preprint arXiv:2507.02782,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.759166Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:4a832cd4a0c6b472ecf7b3b838d4b565eca37b1634bcc5f13e49d844e44592be","observation_id":"cacaa487-f951-4a32-98ad-1e525f433c13","resolution":{"observed_at":"2026-08-01T02:44:01.759166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-01T02:44:01.762231Z","title":"Imanol Schlag, Kazuki Irie, and J¨ urgen Schmidhuber","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.762231Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:37773285651848b093ac78ebc5674ada4458d46a6001b7e565284649fee6dfea","observation_id":"605cdf74-957a-4f14-ac62-1b1260b22e60","resolution":{"observed_at":"2026-08-01T02:44:01.762231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.768663Z","title":"Nitish Srivastava, Geoffrey Hinton, Alex Krizhevsky, Ilya Sutskever, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.768663Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:91104b226d6ca11fbc059760370af12969843d9b896f043ed9794c4d38bb52a9","observation_id":"09998d17-089b-4481-a1c0-3ed0235e0efe","resolution":{"observed_at":"2026-08-01T02:44:01.768663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-01T02:44:01.775013Z","title":"Learning to (learn at test time): Rnns with expressive hidden states.arXiv preprint arXiv:2407.04620,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.775013Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:440cd37a1585ad0f204c3420773b5ef67c0a579255edc9ca63d0c049ff1f501a","observation_id":"22bac524-52f5-44d2-9d11-4ec04458bb3e","resolution":{"observed_at":"2026-08-01T02:44:01.775013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-01T02:44:01.777943Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.777943Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:f6b9dd14903ef06c62ade66698f8f0dd4fb0215f6e8fe2417b1859223aaeec08","observation_id":"356e5538-2115-454f-b84b-fad34a047c83","resolution":{"observed_at":"2026-08-01T02:44:01.777943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T02:44:01.780935Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.780935Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:3afe167d6092ac439a5cbbb26f0bb31506b501d00670020cd618fab43f1c9d7d","observation_id":"9ab79ce3-e90f-454b-96df-5f08e5183d8d","resolution":{"observed_at":"2026-08-01T02:44:01.780935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-01T02:44:01.787201Z","title":"Junxiong Wang, Daniele Paliotta, Avner May, Alexander M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.787201Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:8ad7bc03f8cdb2cc1becf55b971e4b82634ab28cf3e8a49045aa8a19dffb3a87","observation_id":"60dc94cc-e8dd-4649-9610-1df635ec155b","resolution":{"observed_at":"2026-08-01T02:44:01.787201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15237","last_updated":"2025-06-27T07:54:57Z","snapshot_observed_at":"2026-08-16T13:23:25.041410Z","submitted_at":"2024-08-27T17:56:11Z","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15237","snapshot_observed_at":"2026-08-01T02:44:01.790175Z","title":"Kaiyue Wen, Xingyu Dang, and Kaifeng Lyu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.790175Z"},"links":{"cited_paper":"/paper/2408.15237","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:8c25f7e7acbda1af3bb345677260be356cff0fc44a6fd19c07148b930be6c365","observation_id":"039a1726-6e56-4852-8712-b95cf0acf84a","resolution":{"observed_at":"2026-08-01T02:44:01.790175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18510","last_updated":"2024-12-06T19:50:34Z","snapshot_observed_at":"2026-08-16T14:14:26.381058Z","submitted_at":"2024-02-28T17:38:06Z","title":"RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18510","snapshot_observed_at":"2026-08-01T02:44:01.793280Z","title":"An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.793280Z"},"links":{"cited_paper":"/paper/2402.18510","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:66ae6c8e78aa2218371cd9e53618447cf481ecb1643a37cdb053fc9c5b6a4cae","observation_id":"ce02fde9-9344-406a-81d9-9fd55414709f","resolution":{"observed_at":"2026-08-01T02:44:01.793280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-17T21:47:46.144942Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-01T02:44:01.796404Z","title":"Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, and Yoon Kim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.796404Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:a237106c3a5c1222c83a7cabc235fcaac8cd56d8354d31967b00c31f981176c0","observation_id":"74ace254-099d-42ae-be6d-e2461ee23e5a","resolution":{"observed_at":"2026-08-01T02:44:01.796404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-14T21:08:22.323819Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-01T02:44:01.799536Z","title":"Gated delta networks: Improving mamba2 with delta rule.arXiv preprint arXiv:2412.06464, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.799536Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:abf6a6bb4f92256bb10c3feac486568b7ce714d28eff1cc21e1e6e2337244ae2","observation_id":"b1eabf48-e436-4c8a-95b0-9608324d89f6","resolution":{"observed_at":"2026-08-01T02:44:01.799536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-01T02:44:01.802620Z","title":"Tianyuan Zhang, Sai Bi, Yicong Hong, Kai Zhang, Fujun Luan, Songlin Yang, Kalyan Sunkavalli, William T Freeman, and Hao Tan","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.802620Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:61379e265a62ddbc779986e92715c7c4a121fad03421ac74f0ef1aeb6a0920ed","observation_id":"fda620e3-d1d9-4c23-835d-636d034b7e18","resolution":{"observed_at":"2026-08-01T02:44:01.802620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19488","last_updated":"2025-05-26T04:15:38Z","snapshot_observed_at":"2026-08-18T15:48:24.987522Z","submitted_at":"2025-05-26T04:15:38Z","title":"Understanding Transformer from the Perspective of Associative Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19488","snapshot_observed_at":"2026-08-01T02:44:01.805678Z","title":"Understanding transformer from the perspective of associative memory.arXiv preprint arXiv:2505.19488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.805678Z"},"links":{"cited_paper":"/paper/2505.19488","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:c3c6fecba826e5004e74527187bfb48d7b291d783951cff1ea18a6db363362b7","observation_id":"3108fa4a-0c09-4c80-9a01-83e56e3d107c","resolution":{"observed_at":"2026-08-01T02:44:01.805678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.808436Z","title":"Then, S′ t[i]−S t[i] =D t[ik] ∆At ̸=0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.808436Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:8a9f3ef5c3641d4291bbf8015451e71e755355627fda6aa306108f3c22531915","observation_id":"ce706b0d-9076-4126-8622-9cb44b754d95","resolution":{"observed_at":"2026-08-01T02:44:01.808436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.816918Z","title":"One can look at Raven update as applying sparse TTTand only updating selected slots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.816918Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:209170da4c8394ad92e054e911bbda3b99e464496d4b8d889fb09941d1e1bc7a","observation_id":"ee30a630-ad70-4f74-af07-9bd1c94c20fd","resolution":{"observed_at":"2026-08-01T02:44:01.816918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.819934Z","title":"(2025) for more details on the TTT framework","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.819934Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:a1c327fe99e4e4de9b5b4a7b06dcb44c51138caf93d9bb4265db2b75e981184b","observation_id":"4801ea70-a22f-45ab-a1ed-e3bfbab65656","resolution":{"observed_at":"2026-08-01T02:44:01.819934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.813895Z","title":"ot = (Sv t )⊤ softmax Sk t qt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.813895Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:4028724e32d35f9c29676d56e6d95286506cad82311c1316960fcf8e8193ff43","observation_id":"d28c09fc-6c65-4cb9-87c0-d364abbe8d83","resolution":{"observed_at":"2026-08-01T02:44:01.813895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-01T02:44:01.225363Z","title":"Categorical reparameterization with gumbel-softmax.arXiv preprint arXiv:1611.01144,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.225363Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:8903e7cfe394e687a8b4b6dbd816d2a41fc4f3307bf939eb7c4fb7ffde9e9c47","observation_id":"c9b26766-8b97-4bf6-85f2-4ad45d9c6397","resolution":{"observed_at":"2026-08-01T02:44:01.225363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-01T02:44:01.352753Z","title":"Jamba: A hybrid transformer-mamba language model.arXiv preprint arXiv:2403.19887,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.352753Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:6733e61b6a1023a64df07ae8256116cfc5377e93dd231a45d5174cf568e0c16b","observation_id":"8b65c926-6cc7-47c8-bd5a-53e7910d19e9","resolution":{"observed_at":"2026-08-01T02:44:01.352753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-01T02:44:01.771686Z","title":"Roformer: Enhanced transformer with rotary position embedding.arXiv preprint arXiv:2104.09864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.771686Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:07fe08ba164168c4894779078040574484019cf394745bfe321a6f678c01f029","observation_id":"5a8c50b6-c8cf-41b5-9cc9-2139ead39228","resolution":{"observed_at":"2026-08-01T02:44:01.771686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.811139Z","title":"The learning rate follows a cosine scheduler with 1B tokens of warmup","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.811139Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:b24832006c15c3ed3ad4359fe4c226f955cf10785381a46fee92fb0d9ddd4cde","observation_id":"f238a3ee-72f4-42a9-893d-9997efbaaa27","resolution":{"observed_at":"2026-08-01T02:44:01.811139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04245","last_updated":"2020-10-08T20:12:35Z","snapshot_observed_at":"2026-08-16T19:14:50.563961Z","submitted_at":"2020-10-08T20:12:35Z","title":"Query-Key Normalization for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04245","snapshot_observed_at":"2026-08-01T02:44:01.196752Z","title":"Query-key normalization for transformers.arXiv preprint arXiv:2010.04245,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.196752Z"},"links":{"cited_paper":"/paper/2010.04245","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:02127d7346ccc86b4fd0d229c4a75bc019cfd05ab94e656e09f7562e10705b36","observation_id":"adb6bd9a-75e2-4853-af72-5e6c81296650","resolution":{"observed_at":"2026-08-01T02:44:01.196752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05233","last_updated":"2026-06-03T16:16:54Z","snapshot_observed_at":"2026-08-16T14:30:34.288202Z","submitted_at":"2025-06-05T16:50:23Z","title":"MesaNet: Sequence Modeling by Locally Optimal Test-Time Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05233","snapshot_observed_at":"2026-08-01T02:44:01.784214Z","title":"Mesanet: Sequence modeling by locally optimal test-time training.arXiv preprint arXiv:2506.05233,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.784214Z"},"links":{"cited_paper":"/paper/2506.05233","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:de2c9ed0762bee439568a50ff749ca4b93af3a1933fe70554d3a2452cc051f8f","observation_id":"cd8029ce-2182-4b5b-85e8-8723633e43bb","resolution":{"observed_at":"2026-08-01T02:44:01.784214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-01T02:44:01.022592Z","title":"Damai Dai, Chengqi Deng, Chenggang Zhao, RX Xu, Huazuo Gao, Deli Chen, Jiashi Li, Wangding Zeng, Xingkai Yu, Yu Wu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.022592Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:06e56407c6d2d4c75e69c76912b9e2a137cf89d919917123d4cd3383f37721bc","observation_id":"540d22d0-cc26-46d9-b931-ce68e36d6a4d","resolution":{"observed_at":"2026-08-01T02:44:01.022592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-01T02:44:00.838113Z","title":"18 Aaron Blakeman, Aaron Grattafiori, Aarti Basant, Abhibha Gupta, Abhinav Khattar, Adi Renduchintala, Aditya Vavre, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, et al","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.838113Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:35c93c4a39d0caea51a41e8582789aa8cba9dc77757bdba9c929f22573fac9d0","observation_id":"8397736a-771d-4c27-9dd5-058910f07946","resolution":{"observed_at":"2026-08-01T02:44:00.838113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14458","last_updated":"2025-02-23T13:02:09Z","snapshot_observed_at":"2026-08-16T12:56:42.870263Z","submitted_at":"2025-02-20T11:18:39Z","title":"Llamba: Scaling Distilled Recurrent Models for Efficient Language Processing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14458","snapshot_observed_at":"2026-08-01T02:44:00.629498Z","title":"Llamba: Scaling distilled recurrent models for efficient language processing.arXiv preprint arXiv:2502.14458, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.629498Z"},"links":{"cited_paper":"/paper/2502.14458","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:44bd2e28f0296c5f5dc4c0136a4237e71b75d6972a3971450340ea41874b4209","observation_id":"e6133297-6749-42d7-bb0d-11fb83897860","resolution":{"observed_at":"2026-08-01T02:44:00.629498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-01T02:44:01.765490Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.765490Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:3ff3ff5e12fe4834816bd25fb54bfd52285eb88a06e585a51d7ab0b4fced57fc","observation_id":"a8a7e29e-1584-4e8a-a705-6b2dde1c4911","resolution":{"observed_at":"2026-08-01T02:44:01.765490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:01.159652Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.159652Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:35017c2572a14006263b6d12a396c3ec2135962eb55619bdcb3342a83e508842","observation_id":"c6a26fc0-e7a3-436a-89db-e9bcd1a11cc8","resolution":{"observed_at":"2026-08-01T02:44:01.159652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-08-16T14:14:23.399336Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-01T02:44:00.520073Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.520073Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:3fd18765d927584d614365f38f3d23f3790e04fd422379314dcd058b91ae6b02","observation_id":"9ee26bfa-42ca-4364-b248-5e0c1c389792","resolution":{"observed_at":"2026-08-01T02:44:00.520073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-01T02:44:00.582780Z","title":"Longformer: The long-document transformer.arXiv preprint arXiv:2004.05150,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.582780Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:a4ee4587bad2deea34fdd6dc510f745c2492988b6ca36a7531f6b0d4072ee85f","observation_id":"68c66a9b-2880-4726-b5dc-345d555fed32","resolution":{"observed_at":"2026-08-01T02:44:00.582780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:00.967244Z","title":"Peter Clark, Isaac Cowhey, Oren Etzioni, Tushar Khot, Ashish Sabharwal, Carissa Schoenick, and Oyvind Tafjord","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.967244Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:02e5a3217348537eba5609e6700485ccad26df9d354f100e0b570e2ad4398239","observation_id":"c3ea2d40-7641-4342-9fa0-a7b5f45f92a6","resolution":{"observed_at":"2026-08-01T02:44:00.967244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:00.426067Z","title":"github.io/blog/2026/pe/","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:00.426067Z"},"links":{"citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:34606dac17433693a7932e910df07a517c8f7cc4a7b256cfdb168afd857bf6d9","observation_id":"7bffd605-2ec9-4b2c-be23-9e8a8d272c04","resolution":{"observed_at":"2026-08-01T02:44:00.426067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T19:14:38.532525Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2607.25357."}