{"as_of":"2026-08-18T06:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea6e39f42c4407ff24236d827019c8c1617a6dc57857839e44470291e2443662","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T06:58:17.370396Z","state":"measured"},{"denominator":140,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":140,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":109,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:19:30.286857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T12:16:25.390683Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2405.21060"},"observation_digest":"sha256:7bb28bec42c1fd67a00ebda51d28b26c12da6c8b7503ae67b521a379b17907e1","observation_id":"06955ea7-2766-403c-925b-c1127bbe829c","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T10:31:03.777169Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2406.07887"},"observation_digest":"sha256:7feb97a63b5d75dfd8909eb07b50518e00e32cd4ac05784196aff3eaf7a48e6c","observation_id":"2ea19612-848c-4781-bfc9-b911c4afd93d","resolution":{"observed_at":"2026-05-18T10:31:03.952121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T05:20:12.134340Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2407.04620"},"observation_digest":"sha256:a5220338ac1df278aca1785fde909972784d38925bcb757e81cd28269b337510","observation_id":"c3d1962c-1f0b-4826-be5d-5803d408ee51","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T18:31:35.391674Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2410.13846"},"observation_digest":"sha256:2289d74a2e7c2773ba5613cf305c889fdc1aa0dabefcb444770b907af3d0a6ec","observation_id":"33723dc7-91db-4d02-a714-deb19bd93a21","resolution":{"observed_at":"2026-05-23T18:33:19.409017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T19:28:28.652035Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T23:32:43.891248Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.652035Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:661d03bfaa1aebf15d5a4d106f07c3e1f957709217866603de5da60a215c6d5a","observation_id":"00c89e75-9697-4269-b1d7-89f40bde8b1c","resolution":{"observed_at":"2026-08-12T19:28:28.652035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T17:12:32.680612Z","title":"Griffin: Mixing gated linear recurrences with local attention for e fficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12892","last_updated":"2024-11-19T22:17:18Z","snapshot_observed_at":"2026-08-13T12:26:07.656846Z","submitted_at":"2024-11-19T22:17:18Z","title":"Selective Attention: Enhancing Transformer through Principled Context Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:32.680612Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.12892"},"observation_digest":"sha256:0f22c3919e01f232b7b801049552aa9cf3d83aec4674ac77bd39bdd4378db5ea","observation_id":"4ccf5561-4705-4e92-ba3c-7ceb6021ba38","resolution":{"observed_at":"2026-08-12T17:12:32.680612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T16:20:32.762403Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.762403Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:bb7665a5f2f6e68791d71c2510954715563dce0733a7b9bc9f0cdb63e6bbe9aa","observation_id":"221fdb52-126f-4b54-bf02-399f2e468f51","resolution":{"observed_at":"2026-08-12T16:20:32.762403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T12:13:55.170833Z","title":"L., Fernando, A., Botev, A., Cristian- Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y ., Srinivasan, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.170833Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:43554e097eca386a26acf9ac696472a9902930d2d01daeb1ca0225e5e48fd5e2","observation_id":"57bfdbea-7147-42fb-af31-eec34fd06814","resolution":{"observed_at":"2026-08-12T12:13:55.170833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T11:56:33.047492Z","title":"L., Fernando, A., Botev, A., Cristian-Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y., Srinivasan, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17685","last_updated":"2024-11-26T18:52:06Z","snapshot_observed_at":"2026-08-18T06:32:27.100646Z","submitted_at":"2024-11-26T18:52:06Z","title":"Attamba: Attending To Multi-Token States","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T11:56:33.047492Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.17685"},"observation_digest":"sha256:0b41fd2e5d27ca5a337272c134b4db1ad629834c65b4b74e53e1140fe68cacef","observation_id":"c080b9ca-69ca-40fd-978a-c69ae7276dd0","resolution":{"observed_at":"2026-08-12T11:56:33.047492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T10:19:00.101454Z","title":"L., Fernando, A., Botev, A., Cristian- Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y ., Srinivasan, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19379","last_updated":"2025-04-10T05:06:29Z","snapshot_observed_at":"2026-08-16T06:11:44.384590Z","submitted_at":"2024-11-28T21:10:20Z","title":"Marconi: Prefix Caching for the Era of Hybrid LLMs","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T10:19:00.101454Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.19379"},"observation_digest":"sha256:7aecfa51d77c7f9cd912b4d262a5e8db923a9088098e6a8de87cbf34c1062ce0","observation_id":"45fc5245-8876-4b22-b5af-21bb4c1cdacf","resolution":{"observed_at":"2026-08-12T10:19:00.101454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-11T15:45:21.875332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10730","last_updated":"2024-12-14T07:58:24Z","snapshot_observed_at":"2026-08-15T18:39:04.963581Z","submitted_at":"2024-12-14T07:58:24Z","title":"MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:45:21.875332Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2412.10730"},"observation_digest":"sha256:410ee2855cdbe5c8ec440d622cb606ca0d56392db795c938c279ad8679dbf63a","observation_id":"a6cb877e-6a1a-4b05-8e12-be1c1d90dc4f","resolution":{"observed_at":"2026-08-11T15:45:21.875332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-11T13:17:49.920570Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13328","last_updated":"2025-05-25T03:09:17Z","snapshot_observed_at":"2026-08-17T19:42:45.689541Z","submitted_at":"2024-12-17T20:55:42Z","title":"Expansion Span: Combining Fading Memory and Retrieval in Hybrid State Space Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:17:49.920570Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2412.13328"},"observation_digest":"sha256:289da5c0d5ee3f53128832c925abcc20f977f77722d5c2ff44ddc95f1a43848a","observation_id":"35461595-eefe-4b9b-b199-58a8ab6265e1","resolution":{"observed_at":"2026-08-11T13:17:49.920570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-11T00:46:47.564683Z","title":"L.; Fernando, A.; Botev, A.; Cristian-Muraru, G.; Gu, A.; Haroun, R.; Berrada, L.; Chen, Y.; Srinivasan, S.; Desjardins, G.; Doucet, A.; Budden, D.; Teh, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19350","last_updated":"2025-07-04T08:39:27Z","snapshot_observed_at":"2026-08-14T14:56:10.245102Z","submitted_at":"2024-12-26T20:53:04Z","title":"On the Expressiveness and Length Generalization of Selective State-Space Models on Regular Languages","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:46:47.564683Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2412.19350"},"observation_digest":"sha256:095e9dcbcec8787b5f605f79c0334aacd17c0ebf2ce42e5d141209400ac43163","observation_id":"68e731b5-6662-4f69-862a-7e80fd990183","resolution":{"observed_at":"2026-08-11T00:46:47.564683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-10T22:52:33.407687Z","title":"Griffin: Mix- ing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00658","last_updated":"2025-03-11T03:58:57Z","snapshot_observed_at":"2026-08-15T08:43:53.128548Z","submitted_at":"2024-12-31T22:06:39Z","title":"Understanding and Mitigating Bottlenecks of State Space Models through the Lens of Recency and Over-smoothing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:52:33.407687Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2501.00658"},"observation_digest":"sha256:672056631ac64d8fb67faa07afc81160b3c4f323d4706d91be5ab0b40d01bc39","observation_id":"ff742bf8-2803-48b4-990b-dd784d4ac900","resolution":{"observed_at":"2026-08-10T22:52:33.407687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-16T10:45:05.594811Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T22:08:14.982302Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2501.00663"},"observation_digest":"sha256:e3616803d34a634705869798da3ab43ce41fc485df35dd8ddfc0f445e9ddb699","observation_id":"4ad863bf-577d-4590-9214-3901ded4aafd","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-10T22:39:31.411825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01039","last_updated":"2025-01-02T03:41:32Z","snapshot_observed_at":"2026-08-15T18:03:19.320348Z","submitted_at":"2025-01-02T03:41:32Z","title":"MSWA: Refining Local Attention with Multi-ScaleWindow Attention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:39:31.411825Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2501.01039"},"observation_digest":"sha256:2f5d2c312826634a0ebb1f87baac9cbc794d32aa31c81c9ff7cc263b73e06475","observation_id":"44ea67d5-8c86-4734-b520-6a1dbc847437","resolution":{"observed_at":"2026-08-10T22:39:31.411825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-10T17:22:07.027580Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12352","last_updated":"2025-05-02T02:07:05Z","snapshot_observed_at":"2026-08-16T08:25:55.350315Z","submitted_at":"2025-01-21T18:32:31Z","title":"Test-time regression: a unifying framework for designing sequence models with associative memory","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:22:07.027580Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2501.12352"},"observation_digest":"sha256:275b98c3922a9fe8d93f2c3c94a44f4091992d6263f84e4e0a2360f4e7f8344f","observation_id":"7ba4b453-34a9-4e90-a3e4-bb2cb35c86f5","resolution":{"observed_at":"2026-08-10T17:22:07.027580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-10T16:57:29.078058Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12732","last_updated":"2025-01-22T09:09:17Z","snapshot_observed_at":"2026-08-14T13:37:49.807864Z","submitted_at":"2025-01-22T09:09:17Z","title":"GRAMA: Adaptive Graph Autoregressive Moving Average Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T16:57:29.078058Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2501.12732"},"observation_digest":"sha256:460a8f6215de2303f00889aa70a742888649f3035d57f75f61325659e9438eff","observation_id":"64bd7a44-1de4-491a-963a-53bee77dd574","resolution":{"observed_at":"2026-08-10T16:57:29.078058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-10T21:19:23.945339Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16337","last_updated":"2025-01-09T19:13:03Z","snapshot_observed_at":"2026-08-14T07:01:52.586989Z","submitted_at":"2025-01-09T19:13:03Z","title":"Explore Activation Sparsity in Recurrent LLMs for Energy-Efficient Neuromorphic Computing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:19:23.945339Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2501.16337"},"observation_digest":"sha256:46048f460192f69bffb6f82e4190725e873d984854f680ea119f005b87b40878","observation_id":"e9a88c47-c086-40f5-8f71-0df4b92ab72e","resolution":{"observed_at":"2026-08-10T21:19:23.945339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-09T13:05:31.591911Z","title":"L., Fernando, A., Botev, A., Cristian-Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y., Srinivasan, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02209","last_updated":"2025-02-04T10:46:39Z","snapshot_observed_at":"2026-08-13T08:14:57.400399Z","submitted_at":"2025-02-04T10:46:39Z","title":"On the Expressivity of Selective State-Space Layers: A Multivariate Polynomial Approach","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T13:05:31.591911Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2502.02209"},"observation_digest":"sha256:3886652d74f251ed266410d362533e598cccf51f211a025e5a18444ed7ed620d","observation_id":"056e3391-19a9-482c-8f81-e5c0ee415e9c","resolution":{"observed_at":"2026-08-09T13:05:31.591911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-07T22:10:15.888345Z","title":"Smith, Anushan Fernando, Aleksandar Botev, George Cristian-Muraru, Albert Gu, Ruba Haroun, Leonard Berrada, Yutian Chen, Srivatsan Srinivasan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09287","last_updated":"2025-02-13T13:01:46Z","snapshot_observed_at":"2026-08-15T05:31:38.119115Z","submitted_at":"2025-02-13T13:01:46Z","title":"An Uncertainty Principle for Linear Recurrent Neural Networks","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:15.888345Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2502.09287"},"observation_digest":"sha256:d14175f903f33ee8892f3addbf282fedf0dd0c074ece8983886855d9bc63cb51","observation_id":"b16394b4-5d9a-4a44-8eae-af6350b2a513","resolution":{"observed_at":"2026-08-07T22:10:15.888345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-16T16:29:35.500686Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T23:46:29.975858Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2502.11089"},"observation_digest":"sha256:1675c86481689d3ddf711b6a06e7d520014e541f2f7bfdd9cc30007984fde20a","observation_id":"be4a3871-60c1-495e-ab58-550edd005235","resolution":{"observed_at":"2026-05-16T23:46:30.073118Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-16T12:19:30.286857Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13173","last_updated":"2025-04-17T17:59:33Z","snapshot_observed_at":"2026-08-16T19:21:51.005421Z","submitted_at":"2025-04-17T17:59:33Z","title":"It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:30.286857Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2504.13173"},"observation_digest":"sha256:dfea3c105e086b6b7434ec068c018b53b6f3461c28d25d951dda21902401d837","observation_id":"0320d96b-4f2a-41e7-99e8-7e1a7cace126","resolution":{"observed_at":"2026-08-16T12:19:30.286857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-16T11:34:26.698505Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15185","last_updated":"2025-04-21T15:49:27Z","snapshot_observed_at":"2026-08-17T19:53:07.245487Z","submitted_at":"2025-04-21T15:49:27Z","title":"ForgeBench: A Machine Learning Benchmark Suite and Auto-Generation Framework for Next-Generation HLS Tools","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:34:26.698505Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2504.15185"},"observation_digest":"sha256:408ce83ce95457a73bafe5d54a5b516b4bf4ff3ee6e74acd8253f65e152948f3","observation_id":"e208c05f-fcd9-4ad1-babd-562f36e5412e","resolution":{"observed_at":"2026-08-16T11:34:26.698505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-16T11:16:29.630423Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-16T15:32:07.519785Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:29.630423Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2504.16078"},"observation_digest":"sha256:2770f77db080311c85616f1ebdea72bd3aa017645f784a3bffcc66a19ddb6c9a","observation_id":"f2dfb2a3-992d-46be-9a70-efcac9a03df4","resolution":{"observed_at":"2026-08-16T11:16:29.630423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-16T05:58:22.403929Z","title":"L., Fernando, A., Botev, A., Cristian-Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y., Srinivasan, S., Desjardins, G., Doucet, A., Budden, D., Teh, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19561","last_updated":"2025-04-28T08:12:30Z","snapshot_observed_at":"2026-08-16T10:14:54.930380Z","submitted_at":"2025-04-28T08:12:30Z","title":"Quantifying Memory Utilization with Effective State-Size","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:22.403929Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2504.19561"},"observation_digest":"sha256:d7000775337dea0ac5ca5bc4276b534167891366d548a1280dad6a3ddabc4149","observation_id":"0fa4d082-08dd-4cc4-90f1-f21da8c1df1d","resolution":{"observed_at":"2026-08-16T05:58:22.403929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-16T04:40:07.702962Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00630","last_updated":"2025-05-03T09:38:12Z","snapshot_observed_at":"2026-08-17T01:11:36.527426Z","submitted_at":"2025-05-01T16:07:51Z","title":"Vision Mamba in Remote Sensing: A Comprehensive Survey of Techniques, Applications and Outlook","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:07.702962Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2505.00630"},"observation_digest":"sha256:1e7efec0d21e5998863af388e8ffa528c38c22891e005b35d28b4a881bb8f02c","observation_id":"69fb5a92-dc91-4efb-abf8-271cf9a58e50","resolution":{"observed_at":"2026-08-16T04:40:07.702962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-16T04:40:57.775150Z","title":"Grifﬁn: Mixing gated linear recurrences with local attention for efﬁcient language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00776","last_updated":"2025-05-01T18:12:30Z","snapshot_observed_at":"2026-08-16T04:32:48.736437Z","submitted_at":"2025-05-01T18:12:30Z","title":"Reasoning Capabilities and Invariability of Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:57.775150Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2505.00776"},"observation_digest":"sha256:1279423b3ddddc05431c382e4fc241d33bf659850f293629222a83c55ba5cfea","observation_id":"def813ee-7313-44f2-919a-5f6881eec9ed","resolution":{"observed_at":"2026-08-16T04:40:57.775150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-07T14:32:36.596300Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18728","last_updated":"2026-05-26T08:20:42Z","snapshot_observed_at":"2026-08-14T09:58:06.733761Z","submitted_at":"2025-05-24T14:53:07Z","title":"Message-Passing State-Space Models: Improving Graph Learning with Modern Sequence Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:36.596300Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2505.18728"},"observation_digest":"sha256:1db94b818011b84556c2a8a1108d1d75654673b814ce62a60a3037c9cbb568d8","observation_id":"ced32ed0-de43-45dd-84c4-b0d6b4dff9f9","resolution":{"observed_at":"2026-08-07T14:32:36.596300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-07T14:14:08.747322Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19827","last_updated":"2025-05-26T11:04:59Z","snapshot_observed_at":"2026-08-10T09:29:01.974309Z","submitted_at":"2025-05-26T11:04:59Z","title":"Revisiting Glorot Initialization for Long-Range Linear Recurrences","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:08.747322Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2505.19827"},"observation_digest":"sha256:0f5052ac9c6d808836430b13ff5b465eddc6f4cc78652caada172043ef354f56","observation_id":"6e69752c-4362-44d3-abba-04e2c13ff613","resolution":{"observed_at":"2026-08-07T14:14:08.747322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-07T13:54:45.020020Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models.arXiv preprint arXiv:2402.19427,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20698","last_updated":"2025-05-27T04:07:23Z","snapshot_observed_at":"2026-08-15T00:50:37.170463Z","submitted_at":"2025-05-27T04:07:23Z","title":"Sparsified State-Space Models are Efficient Highway Networks","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:45.020020Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2505.20698"},"observation_digest":"sha256:dd37991c1a1d52ed0abd5fc8416ec0cd5230ed7d4bc9a1cec26847af2cebed3b","observation_id":"4e84e033-a2a6-4b5f-af98-82f51edd9fb1","resolution":{"observed_at":"2026-08-07T13:54:45.020020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-07T13:11:41.546011Z","title":"L., Fernando, A., Botev, A., Cristian-Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y., Srinivasan, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22560","last_updated":"2025-05-28T16:38:35Z","snapshot_observed_at":"2026-08-17T03:44:56.314464Z","submitted_at":"2025-05-28T16:38:35Z","title":"Geometric Hyena Networks for Large-scale Equivariant Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:11:41.546011Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2505.22560"},"observation_digest":"sha256:8df9e820edb6ed023e5711f626d2eacbae01fcb2cd8bbe1b0dbb42d293ae6c7d","observation_id":"62752f89-cdd0-4fdc-a32d-e0684ef8d378","resolution":{"observed_at":"2026-08-07T13:11:41.546011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-07T10:30:12.746450Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05233","last_updated":"2026-06-03T16:16:54Z","snapshot_observed_at":"2026-08-16T14:30:34.288202Z","submitted_at":"2025-06-05T16:50:23Z","title":"MesaNet: Sequence Modeling by Locally Optimal Test-Time Training","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:30:12.746450Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2506.05233"},"observation_digest":"sha256:dd217871d73caf71d762fb9610130827afa5d613e6fc9be3ad85208d3f00753f","observation_id":"51c5621c-26de-4fc5-a3fb-9b8fc8667510","resolution":{"observed_at":"2026-08-07T10:30:12.746450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-07T05:56:23.523266Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06708","last_updated":"2025-06-07T08:09:26Z","snapshot_observed_at":"2026-08-16T11:05:12.025546Z","submitted_at":"2025-06-07T08:09:26Z","title":"A Survey of Retentive Network","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:56:23.523266Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2506.06708"},"observation_digest":"sha256:8afba811419e6b4b482d171985691e521fb631c3361322cc32e379ac3fad6bea","observation_id":"55da58e0-17ae-4336-a8a0-252aad8ba740","resolution":{"observed_at":"2026-08-07T05:56:23.523266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-06T23:28:44.335630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18145","last_updated":"2025-06-22T19:26:55Z","snapshot_observed_at":"2026-08-09T03:15:44.813103Z","submitted_at":"2025-06-22T19:26:55Z","title":"Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:44.335630Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2506.18145"},"observation_digest":"sha256:f222015add5318992b45d5dd12a1387055ac34bb1dd62c36999cae5c1f10e9d2","observation_id":"e10fe4ab-9031-49e5-a69c-d6f1a50e3800","resolution":{"observed_at":"2026-08-06T23:28:44.335630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T11:17:24.406028Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:208368b53ea1d49dfdc9fcc06f21a1f23769d631084390c939991d923b6caa5c","observation_id":"ebc456d3-14e0-4f9f-ab24-06bafc44b2d6","resolution":{"observed_at":"2026-05-15T11:17:24.628777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-06T20:40:11.917229Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models.arXiv preprint arXiv:2402.19427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:40:11.917229Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:afd1c0624f75241062833644387adcacd0a5e5fbedf62d18e815db5b72a5fc8a","observation_id":"c333a267-75e7-4be8-bc80-e3cfba4385c1","resolution":{"observed_at":"2026-08-06T20:40:11.917229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-06T20:29:49.624319Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models.arXiv preprint arXiv:2402.19427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-16T03:11:40.337117Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.624319Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:38b079d4ceddd1d75a28148bd413273337f8f5ebca4caec3fd66712a910d0898","observation_id":"889cdfca-77ea-444e-be11-5f1d974dba96","resolution":{"observed_at":"2026-08-06T20:29:49.624319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-06T19:09:55.788354Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-08-14T00:11:56.379317Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:09:55.788354Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.06457"},"observation_digest":"sha256:dbac7387fecffe24a69911723d073b67be05da316de0589081b95301d124810c","observation_id":"3434b521-120a-42f8-ba19-6eb9e017bf1d","resolution":{"observed_at":"2026-08-06T19:09:55.788354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-08-16T17:15:59.946268Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:2166c8d9713a4868a626d454a07ab26a25ef5058082582eee8b827bc931df922","observation_id":"ad621e97-2937-4b58-bf06-027b3959d7c1","resolution":{"observed_at":"2026-05-19T04:42:04.534710Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-06T11:44:04.925289Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.925289Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:41b56247e1b79909d03d7630918e6ba8cf8f7a8c275e450392bb4b0a429d909f","observation_id":"1391d620-ee6f-4a0c-9b19-b0c38e309ee1","resolution":{"observed_at":"2026-08-06T11:44:04.925289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2509.05276","last_updated":"2026-05-08T09:41:26Z","snapshot_observed_at":"2026-08-11T05:30:18.498214Z","submitted_at":"2025-09-05T17:34:00Z","title":"SpikingBrain: Spiking Brain-inspired Large Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T18:51:06.243305Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2509.05276"},"observation_digest":"sha256:6bcc45e4647d4e63f05762ab30dee3a4367ddc0f63274fa40078dea6f70d8237","observation_id":"3708a5fe-043a-4854-917d-3b1719bd4270","resolution":{"observed_at":"2026-05-18T18:51:45.775697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T05:29:21.297289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-14T20:35:20.665795Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.297289Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:01aa139f80847fb20206f8d99cae2eba202d80215dc4a95b089653f7d5a26c7c","observation_id":"9f1ea1b3-5a5c-4b25-ba5a-f1778b03a762","resolution":{"observed_at":"2026-08-05T05:29:21.297289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2509.24552","last_updated":"2026-05-04T14:21:45Z","snapshot_observed_at":"2026-08-17T15:02:20.943642Z","submitted_at":"2025-09-29T10:04:12Z","title":"Short window attention enables long-term memorization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T12:10:42.646127Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2509.24552"},"observation_digest":"sha256:cc6fec856536860ac2ae479d1cd7b26353a3f3225cff164d2a62da7ba5cab04c","observation_id":"48db92f2-b4c7-4b96-867b-744794c02828","resolution":{"observed_at":"2026-05-18T12:11:21.808263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:c62add0d61af9c308f3fab002d71ef2d8899718b536f776dce446a31b942021b","observation_id":"82a3cfd6-46e4-4b09-877f-f83ccafb0747","resolution":{"observed_at":"2026-05-18T10:21:15.108907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-03T21:20:34.467266Z","title":"Griffin: Mix- ing gated linear recurrences with local attention for efficient language models.arXiv preprint arXiv:2402.19427,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-16T11:39:02.353315Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.467266Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:3f81100b6427d22dcdb68b528954847677cc859eda1f2bf63a3d76cba0fbb19d","observation_id":"60ec5ed0-64e6-4810-b69a-d0a5625e074e","resolution":{"observed_at":"2026-08-03T21:20:34.467266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2511.17388","last_updated":"2026-06-23T17:12:17Z","snapshot_observed_at":"2026-08-15T03:11:50.414827Z","submitted_at":"2025-11-21T16:50:00Z","title":"Selective Rotary Position Embedding","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T20:36:49.650895Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2511.17388"},"observation_digest":"sha256:aa52c39d43c1ae3cd146537f3a9fc33993559108b32c2b6dfea863f33364960e","observation_id":"863a79ef-9659-4fb0-b88e-684dc47799f3","resolution":{"observed_at":"2026-05-17T20:40:14.861957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-03T21:03:18.981806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17388","last_updated":"2026-06-23T17:12:17Z","snapshot_observed_at":"2026-08-15T03:11:50.414827Z","submitted_at":"2025-11-21T16:50:00Z","title":"Selective Rotary Position Embedding","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T21:03:18.981806Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2511.17388"},"observation_digest":"sha256:71551391c7aef5895e27b9b3dffa3822eb28d6b230eebed05d85f0187b921190","observation_id":"499c3aa2-5ce8-4b8a-b40f-535f35f94d3b","resolution":{"observed_at":"2026-08-03T21:03:18.981806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-08-15T20:35:30.171419Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:23.826110Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2511.21016"},"observation_digest":"sha256:3ef0443df22e1fc3dd691742db2171e19e0f6fe6e8f416f1774e39345316d64a","observation_id":"af9b1816-3b38-4915-8786-0b4661921526","resolution":{"observed_at":"2026-05-21T18:00:27.115409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-03T15:22:48.561819Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models.arXiv preprint arXiv:2402.19427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-17T09:18:32.359725Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:48.561819Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:63989ea583b646c274940131622e0f5859570cc631773cc5837175b0095b0a89","observation_id":"6f226ae0-8f0e-4025-88d8-a9f70e0c8272","resolution":{"observed_at":"2026-08-03T15:22:48.561819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-03T10:12:43.396788Z","title":"arXiv preprint arXiv:2402.19427 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.396788Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:accc1f5a94d3c80e2abf06a03b9cfb236d3e2980c19fd5a32a3c6a1272ccf6b4","observation_id":"3b83e026-48db-4285-9fa0-0126f68688f8","resolution":{"observed_at":"2026-08-03T10:12:43.396788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2602.13215","last_updated":"2026-05-13T00:21:04Z","snapshot_observed_at":"2026-08-16T11:25:01.080136Z","submitted_at":"2026-01-22T17:19:58Z","title":"When to Think Fast and Slow? AMOR: Adaptive Entropy Gate for Hybrid Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T11:48:50.587732Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2602.13215"},"observation_digest":"sha256:77e9ea13100414e1af89748c7595be8e8f524430df58c1dedc59f813d1c6e819","observation_id":"18a0e62c-33ee-474a-9528-d0cb10165e65","resolution":{"observed_at":"2026-05-16T11:50:52.802578Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-12T12:18:11.807003Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T20:59:33.902420Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:2b2bc10eaaae2e2d7904a4b0ac9c75340910800c0121282a2d247f5cfadd8004","observation_id":"38ac6792-76ff-4180-82a3-fead463c9dcf","resolution":{"observed_at":"2026-05-15T21:00:17.897130Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-12T12:18:11.807003Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T12:45:27.150368Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:34686ba39c7153ad5399b724a92ba0fc24435c63532685fa4574fa6ff7582327","observation_id":"d4c25bb4-d24c-44a4-a2f9-991ef4125905","resolution":{"observed_at":"2026-05-21T12:50:09.519771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-02T22:05:42.987805Z","title":"L., Fernando, A., Botev, A., Cristian- Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y ., Srinivasan, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-12T12:18:11.807003Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T22:05:42.987805Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:fecc61e6884de6fd43a47e53b2cc5bd94ca3d363533f68b5aabb98884ab32886","observation_id":"98aafb65-e4c0-4f2a-9a27-cbbbbc0b0d3d","resolution":{"observed_at":"2026-08-02T22:05:42.987805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2603.20997","last_updated":"2026-04-16T07:49:51Z","snapshot_observed_at":"2026-08-16T04:19:08.753129Z","submitted_at":"2026-03-22T01:04:57Z","title":"When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T06:24:41.108227Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2603.20997"},"observation_digest":"sha256:18bf9ab9aab7cc0dd3a96366b59a9329b9694cf63cbc2a1a0623fe7ef58ddf9f","observation_id":"daa7580c-ff19-4d6f-8931-76acb0864547","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-02T17:21:21.451268Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26556","last_updated":"2026-07-17T10:32:57Z","snapshot_observed_at":"2026-08-17T22:12:53.484781Z","submitted_at":"2026-03-27T16:16:23Z","title":"When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T17:21:21.451268Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2603.26556"},"observation_digest":"sha256:35a35b5b25db42ce85e6fa8e1bb6c7be768af8685c62cdcdfd64b42788f80325","observation_id":"50eab17c-36ae-4490-acd5-02b0dccfdb7d","resolution":{"observed_at":"2026-08-02T17:21:21.451268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.03263","last_updated":"2026-03-12T21:21:51Z","snapshot_observed_at":"2026-08-14T20:05:21.610854Z","submitted_at":"2026-03-12T21:21:51Z","title":"LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T11:22:08.937342Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.03263"},"observation_digest":"sha256:901358cb46dd27758326957d90cb1fce0882a84c14e2c1355ce8982d49037ae6","observation_id":"92a3e1eb-c599-41c1-a96a-74bd0879067a","resolution":{"observed_at":"2026-05-15T11:25:31.080573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.03829","last_updated":"2026-07-20T06:36:40Z","snapshot_observed_at":"2026-08-15T13:48:39.393799Z","submitted_at":"2026-04-04T19:02:52Z","title":"Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T16:55:36.438348Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.03829"},"observation_digest":"sha256:cb850ee8a6772cf9cf591744a0a3febdf6967bd101b901afa35be4f0ee4c6404","observation_id":"e0b7d0a9-90b9-4854-b824-0dab5b38ea57","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-02T16:51:07.301614Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03829","last_updated":"2026-07-20T06:36:40Z","snapshot_observed_at":"2026-08-15T13:48:39.393799Z","submitted_at":"2026-04-04T19:02:52Z","title":"Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T16:51:07.301614Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.03829"},"observation_digest":"sha256:858c86206c599c44f81541cf41d83f6a5e15d33c0143ff5c0c093c38be5db1a3","observation_id":"df3bb33e-85ce-467e-a284-af7124e56847","resolution":{"observed_at":"2026-08-02T16:51:07.301614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-07-13T10:31:11.574398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04250","last_updated":"2026-04-05T20:13:22Z","snapshot_observed_at":"2026-08-14T17:12:56.350104Z","submitted_at":"2026-04-05T20:13:22Z","title":"CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-13T10:31:11.574398Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.04250"},"observation_digest":"sha256:ba91f79bb640e419c15874e6a33a840331631c7ff50a8442993e5d5d6f7b63d8","observation_id":"9cdce8f7-b0c3-485f-ade1-7cdee9c524c2","resolution":{"observed_at":"2026-07-13T10:31:11.574398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.05030","last_updated":"2026-04-28T16:30:21Z","snapshot_observed_at":"2026-08-11T06:17:25.450178Z","submitted_at":"2026-04-06T18:00:03Z","title":"Phase-Associative Memory: Sequence Modeling in Complex Hilbert Space","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T19:39:50.311059Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.05030"},"observation_digest":"sha256:cd09829df1b9a50af9d791e414071b492e329c37ee6e4c930541194151d9d6d9","observation_id":"6400ba6b-3a57-4e36-9564-fd52ac10af70","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.07658","last_updated":"2026-04-08T23:54:57Z","snapshot_observed_at":"2026-07-06T22:55:50.808914Z","submitted_at":"2026-04-08T23:54:57Z","title":"Optimal Decay Spectra for Linear Recurrences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:15.178258Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.07658"},"observation_digest":"sha256:4c918650be6d7a87f0b592bf93646695142a085556e8057798e437a3aa7c9225","observation_id":"701eff04-23f3-44ac-b058-ca11003e9a80","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.10582","last_updated":"2026-04-12T11:02:13Z","snapshot_observed_at":"2026-08-11T18:10:49.364139Z","submitted_at":"2026-04-12T11:02:13Z","title":"TAPNext++: What's Next for Tracking Any Point (TAP)?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:15.631211Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.10582"},"observation_digest":"sha256:6222bae30c4e80fc51d3e16958dd84c4b7176daf0b2340f8f50fc6eed4316b04","observation_id":"a32ec29c-a010-4964-94b3-eecb39f70070","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.14501","last_updated":"2026-04-16T00:30:45Z","snapshot_observed_at":"2026-08-14T16:00:44.726671Z","submitted_at":"2026-04-16T00:30:45Z","title":"On the Expressive Power and Limitations of Multi-Layer SSMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:36:09.265655Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.14501"},"observation_digest":"sha256:1762da4530eb25331f0546cd2d4ecd1d0d3cc61d242a5a9bc5a28f64209ed710","observation_id":"a45c8722-7873-4785-876a-8a40cd86a7dd","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.19343","last_updated":"2026-04-21T11:26:06Z","snapshot_observed_at":"2026-08-11T15:24:10.318224Z","submitted_at":"2026-04-21T11:26:06Z","title":"Scalable Memristive-Friendly Reservoir Computing for Time Series Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T01:10:45.859345Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.19343"},"observation_digest":"sha256:d726216c3ad19acd74012d1ae39826a48c31e7e364db007087d73ede0b41ef05","observation_id":"56d86a29-2489-4db4-b253-f5d44635e2d1","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.22442","last_updated":"2026-04-24T10:59:30Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T10:59:30Z","title":"HubRouter: A Pluggable Sub-Quadratic Routing Primitive for Hybrid Sequence Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:21:07.816749Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.22442"},"observation_digest":"sha256:e761992ec28e5d247337273dd6f5929c262697c3ed168b309c514c2961d9a381","observation_id":"75eff084-6ebd-43c0-856c-502724664f30","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2604.22575","last_updated":"2026-04-24T14:07:54Z","snapshot_observed_at":"2026-08-15T20:32:04.105656Z","submitted_at":"2026-04-24T14:07:54Z","title":"SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T12:18:23.898779Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2604.22575"},"observation_digest":"sha256:f085e9753bb7225e9a95db31895de6c349f69a7382117444bcda343fc5e3154d","observation_id":"ddd9849a-3219-4fcf-b569-e3919cb12db7","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.05066","last_updated":"2026-08-06T14:35:06Z","snapshot_observed_at":"2026-08-17T16:25:09.243513Z","submitted_at":"2026-05-06T16:01:43Z","title":"The Impossibility Triangle of Long-Context Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T17:17:44.033300Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.05066"},"observation_digest":"sha256:19a6ab16ebc0fd4bb50a266347d994ac54f5c242aeb6ef9c806f557a4dce6a94","observation_id":"089576dd-8998-4e0e-a175-7547cbf926bf","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.05113","last_updated":"2026-05-06T16:44:44Z","snapshot_observed_at":"2026-08-06T00:17:33.848277Z","submitted_at":"2026-05-06T16:44:44Z","title":"How Long Does Infinite Width Last? Signal Propagation in Long-Range Linear Recurrences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T17:52:21.272304Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.05113"},"observation_digest":"sha256:e0da46195437747c092c5fbfac4a4d54ea5b0536d168932d209c1db6cba3b23e","observation_id":"7340369a-81bb-4691-9c29-ce1f099bc359","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.05488","last_updated":"2026-05-06T22:23:07Z","snapshot_observed_at":"2026-08-02T11:07:22.020421Z","submitted_at":"2026-05-06T22:23:07Z","title":"A Robust Foundation Model for Conservation Laws: Injecting Context into Flux Neural Operators via Recurrent Vision Transformers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T16:52:57.496945Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.05488"},"observation_digest":"sha256:b90baba78447953669640fe637522597b63a29ca164f7148a7b8783ab3b95b1d","observation_id":"4377f820-c8ca-440a-83e0-675a877b3276","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-08-11T13:03:21.866594Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:1abe079fac17eab8f15ed18d0f3f60f1c34ea93e9db1bf245d222ad9ae1aaf99","observation_id":"64cc7df7-1c6f-4b56-b12a-afdc3eb9d202","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-08-12T13:51:17.409580Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:c3f8107be0adf44bc4bf2549edd9a432c02f8a0f9ffc1a8a18a8fbf12180325d","observation_id":"96e8e322-c921-43a0-b314-a6df5715f1a1","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-08-15T01:18:14.451523Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:75ae542a00acf22061bdf90bfa4e218f6b4e7b83c2b15931431094a279ab747a","observation_id":"790946f8-6032-4a68-b1ba-7269b092e9e3","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.10268","last_updated":"2026-05-11T09:30:59Z","snapshot_observed_at":"2026-08-16T02:54:34.724405Z","submitted_at":"2026-05-11T09:30:59Z","title":"MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T05:22:43.330891Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.10268"},"observation_digest":"sha256:9db82c20f12adddd0ee82ba7fc2a1d1c2d679e8bc098e9575ec0bd7a3d232600","observation_id":"401870ed-087a-44c5-b4b1-d6c4e4c9aeef","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.10643","last_updated":"2026-05-11T14:31:24Z","snapshot_observed_at":"2026-08-16T03:31:10.860879Z","submitted_at":"2026-05-11T14:31:24Z","title":"A Single-Layer Model Can Do Language Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:40:12.906234Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.10643"},"observation_digest":"sha256:42d01f660bd12948b01dab64c19f75b6647ef27ee50e582a6d6175834cb1c735","observation_id":"9dfb6fda-8d60-4f2c-b257-bcb8a0fa20ed","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.17875","last_updated":"2026-05-18T05:37:25Z","snapshot_observed_at":"2026-08-14T13:24:28.834097Z","submitted_at":"2026-05-18T05:37:25Z","title":"HexagonalWarriorMamba: Superior Threshold-Dependent Multi-label Classification of 12-Lead ECG Cardiac Abnormalities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:41.887085Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.17875"},"observation_digest":"sha256:e02466fe63153cbe6ea1ea779c5003cd2f932dc9451c053a40c6f56a282e756d","observation_id":"83d8a01a-56d0-4642-b16b-1c7036365860","resolution":{"observed_at":"2026-05-20T11:58:14.929076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.18826","last_updated":"2026-05-12T19:00:17Z","snapshot_observed_at":"2026-08-15T05:28:48.827100Z","submitted_at":"2026-05-12T19:00:17Z","title":"The Routing and Filtering Structure of Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T22:04:15.518405Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.18826"},"observation_digest":"sha256:b9aa8c4f5990dda8296d56a0325e4ef6e58ca429ef38fd2c1fe9a93384d04cb7","observation_id":"e1fae2d7-c4ea-4e00-96f4-2c0b0b29b0dd","resolution":{"observed_at":"2026-05-20T22:09:07.720892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.19150","last_updated":"2026-05-18T22:06:33Z","snapshot_observed_at":"2026-08-16T10:55:30.399562Z","submitted_at":"2026-05-18T22:06:33Z","title":"Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T11:48:42.834602Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.19150"},"observation_digest":"sha256:dc0e4e35c27a9928f30515023a25f98506fb35035bdb15de914abfad6afe2dd6","observation_id":"0c87302f-66bf-4d22-bba4-ee4092b054db","resolution":{"observed_at":"2026-05-20T11:53:15.168578Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.21070","last_updated":"2026-05-20T11:56:15Z","snapshot_observed_at":"2026-08-15T23:56:17.773250Z","submitted_at":"2026-05-20T11:56:15Z","title":"Towards Understanding Self-Pretraining for Sequence Classification","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-21T05:29:58.809024Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.21070"},"observation_digest":"sha256:a7bf1c5b98eae1c35d22d464bcae93521680d0ad505734bb561feae58992d896","observation_id":"4aa09321-2184-4788-ac6f-37eaa4c3edd2","resolution":{"observed_at":"2026-05-21T05:33:58.868560Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.24330","last_updated":"2026-05-23T01:18:00Z","snapshot_observed_at":"2026-08-13T13:01:40.220759Z","submitted_at":"2026-05-23T01:18:00Z","title":"Interdomain Attention: Beyond Token-Level Key-Value Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.24330"},"observation_digest":"sha256:dc725edd07c5b8d0d9a21ea7283d6affa776076876e0773be38b591130543663","observation_id":"e4cfe493-1848-4837-9464-cef8867d4bcf","resolution":{"observed_at":"2026-06-30T14:04:44.092256Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.26099","last_updated":"2026-06-05T05:36:49Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:55:39Z","title":"Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T21:37:51.638904Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.26099"},"observation_digest":"sha256:635cea77e418a4a7e54a8596c6af9a7acfde263764fa55ecc754a8bce98a32d8","observation_id":"9fab381a-a2bf-4a65-9094-474dbe26edb4","resolution":{"observed_at":"2026-06-29T21:43:59.493853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-13T01:57:28.078266Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:8c31f433146144fb0881f97b16cee3b2d5edfe3e2ce466d998d6755a45f97243","observation_id":"2efbb355-3685-403c-8cb5-003ce1c758cb","resolution":{"observed_at":"2026-06-29T19:43:54.937865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.31163","last_updated":"2026-08-09T14:33:02Z","snapshot_observed_at":"2026-08-13T23:28:18.289669Z","submitted_at":"2026-05-29T11:13:00Z","title":"Memory by Design: Probabilistic Sequence Layers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T21:07:31.407554Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.31163"},"observation_digest":"sha256:a5c0ec61438c394c723a951cbbd60e2e3f4283dde789371b0cdcc3ac00405a4f","observation_id":"e3f096b0-1cbd-4357-b8e1-626a9d28993d","resolution":{"observed_at":"2026-07-01T20:26:12.920120Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.31367","last_updated":"2026-05-29T14:38:50Z","snapshot_observed_at":"2026-08-10T13:03:27.075396Z","submitted_at":"2026-05-29T14:38:50Z","title":"Trading Complexity for Expressivity Through Structured Generalized Linear Token Mixing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.31367"},"observation_digest":"sha256:e332485c92470fc3ba6fde7d865a505beacf0d691dd8f21fb72c3ad9802da6dc","observation_id":"48ca4380-ab64-4ea9-aab1-9d50ceb66ddb","resolution":{"observed_at":"2026-06-28T23:02:45.801805Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.02332","last_updated":"2026-06-02T05:51:37Z","snapshot_observed_at":"2026-08-12T12:19:54.312161Z","submitted_at":"2026-06-01T14:42:06Z","title":"Forget Attention: Importance-Aware Attention Is All You Need","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T14:38:40.948032Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.02332"},"observation_digest":"sha256:eb24ead9880aa63e4019205665f61540339c37779be2affcf2719d6f5a4ba122","observation_id":"88cd020b-e37e-4376-b097-65ad34fab426","resolution":{"observed_at":"2026-07-01T23:06:21.029340Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.04438","last_updated":"2026-06-03T04:38:12Z","snapshot_observed_at":"2026-08-15T15:58:52.730152Z","submitted_at":"2026-06-03T04:38:12Z","title":"LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T07:19:31.075298Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.04438"},"observation_digest":"sha256:97e565af8fd7848137929fc19b93a8f3711cb352b9cf8a815df9c25dff57ae86","observation_id":"02f27307-df19-4fa0-8a6a-6ce6cce7549b","resolution":{"observed_at":"2026-07-02T06:36:44.182382Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.08573","last_updated":"2026-06-07T11:07:30Z","snapshot_observed_at":"2026-08-17T02:59:09.010268Z","submitted_at":"2026-06-07T11:07:30Z","title":"Titans-as-a-Layer: Test-Time Memory for Conversational Speech Emotion Recognition","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T18:28:44.652813Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.08573"},"observation_digest":"sha256:72657c8459e1e02513f05de0a242d025d102f9de2c24632f89ab3d67111b8c47","observation_id":"324b4bc8-0224-4646-9c55-f236ee2be205","resolution":{"observed_at":"2026-07-02T23:07:26.839436Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.09862","last_updated":"2026-05-31T17:43:06Z","snapshot_observed_at":"2026-08-13T21:25:54.172372Z","submitted_at":"2026-05-31T17:43:06Z","title":"Blurry Window Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:43:34.429061Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.09862"},"observation_digest":"sha256:bda2f85736cc7018179e6cdefcf965f9b234a299454f98d2ba3dd44bceb7d999","observation_id":"b25d24ce-a02b-48a6-b3bd-039a3bc986c2","resolution":{"observed_at":"2026-07-01T20:46:14.017951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.11049","last_updated":"2026-06-09T16:14:45Z","snapshot_observed_at":"2026-08-12T17:20:44.147127Z","submitted_at":"2026-06-09T16:14:45Z","title":"Free Parametrization of L_2-Bounded Structured State-Space Controllers for Nonlinear Control with Stability Guarantees","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T12:08:57.506333Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.11049"},"observation_digest":"sha256:7bbeac18529268067e1a4d3822fcf011efaebaf34a4f89b56f0102a63820a036","observation_id":"a25b4ef6-89f8-44d7-b979-031b11ffa75b","resolution":{"observed_at":"2026-06-27T12:10:53.818017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.11396","last_updated":"2026-06-09T19:36:25Z","snapshot_observed_at":"2026-08-12T21:20:55.322050Z","submitted_at":"2026-06-09T19:36:25Z","title":"PLUME: Probabilistic Latent Unified World Modeling and Parameter Estimation for Multi-Finger Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T12:50:32.341334Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.11396"},"observation_digest":"sha256:d8f3d02cfada6b2b3328f309d41e8d05ca9dcf0be1ac13cf33c970543dc0eadc","observation_id":"e1a196cd-9290-4ccc-96b3-02e2ec849791","resolution":{"observed_at":"2026-07-03T06:17:41.379799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-12T13:36:16.324487Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:73e4e343f2a8d022ddc8786765344b5c65d82835f24642446e3474244f73de6a","observation_id":"63a05911-a45c-4fd6-a0f0-b66700b73686","resolution":{"observed_at":"2026-07-03T09:47:59.882874Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.19901","last_updated":"2026-06-18T07:56:28Z","snapshot_observed_at":"2026-08-12T15:45:28.751207Z","submitted_at":"2026-06-18T07:56:28Z","title":"Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T18:06:22.521551Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.19901"},"observation_digest":"sha256:7f0f25dd6ad226296aff12493db0ec7cfc3ad7b5f9024e33e17084a3d8de8ce3","observation_id":"cef66bdb-d22a-40e8-a56b-ae62af49193e","resolution":{"observed_at":"2026-07-04T03:29:29.435897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.23670","last_updated":"2026-06-22T17:56:25Z","snapshot_observed_at":"2026-08-12T14:08:49.266214Z","submitted_at":"2026-06-22T17:56:25Z","title":"Tapered Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T09:11:20.341634Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.23670"},"observation_digest":"sha256:32af56a4b6071447191580ea83276b51205f8b1ecd8409fd456b0a8a85a15224","observation_id":"56711364-b5c6-438f-b08b-655bbb5d52a3","resolution":{"observed_at":"2026-07-04T09:59:45.305176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.24650","last_updated":"2026-05-30T07:39:01Z","snapshot_observed_at":"2026-07-06T23:59:13.320720Z","submitted_at":"2026-05-30T07:39:01Z","title":"Harmonic: Hierarchical State Space Models for Efficient Long-Context Language Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T18:55:19.253621Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.24650"},"observation_digest":"sha256:29370b1a2380af0ccbe5be061eeb6fc54a33a33eda89e0e1c342231da4221dbd","observation_id":"df893389-7fa6-4dbe-bedc-a57a55a99500","resolution":{"observed_at":"2026-06-28T19:42:35.933085Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.26290","last_updated":"2026-06-24T18:36:31Z","snapshot_observed_at":"2026-08-13T12:07:29.608979Z","submitted_at":"2026-06-24T18:36:31Z","title":"SSM Adapters via Hankel Reduced-order Modeling: Injection Site Determines Task Suitability in Long-Context Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T01:46:44.408246Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.26290"},"observation_digest":"sha256:19a7b13b27346a31d466b8825608d43bf76d18de7cc8c0efbe28da93ac500470","observation_id":"fdc4b206-788c-4312-b5af-077c67d64a90","resolution":{"observed_at":"2026-07-04T15:19:56.025588Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.27229","last_updated":"2026-07-06T18:45:56Z","snapshot_observed_at":"2026-08-15T08:40:34.621546Z","submitted_at":"2026-06-25T16:16:51Z","title":"CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T04:26:00.066003Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.27229"},"observation_digest":"sha256:9633cd66997b1c42b4c56639219367852c8ae7756018442344312776c773d4cc","observation_id":"c128b580-bcc7-4126-b36b-bf9276309c66","resolution":{"observed_at":"2026-07-04T14:09:53.441851Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.27229","last_updated":"2026-07-06T18:45:56Z","snapshot_observed_at":"2026-08-15T08:40:34.621546Z","submitted_at":"2026-06-25T16:16:51Z","title":"CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T09:42:52.096671Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.27229"},"observation_digest":"sha256:04800a1c2e8b9aa7c4c3b450ef5df5c5f52f2a1cfba86f3085bc00b22e650af5","observation_id":"2f81bd82-e038-42cd-a18e-3791e2cff5fd","resolution":{"observed_at":"2026-06-30T09:44:37.449959Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-07-12T11:49:31.618283Z","title":"Smith, Anushan Fernando, Aleksandar Botev, George Cristian-Muraru, Albert Gu, Ruba Haroun, Léonard Kadri, Robert Kundu, David Muraru, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27229","last_updated":"2026-07-06T18:45:56Z","snapshot_observed_at":"2026-08-15T08:40:34.621546Z","submitted_at":"2026-06-25T16:16:51Z","title":"CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T11:49:31.618283Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.27229"},"observation_digest":"sha256:2f476c5eb984ae465eaa91b427dd8c98ccf0cb3edb61ac99985e151fab8c7910","observation_id":"21955ff2-0e38-425b-9bf5-0f884c42ab49","resolution":{"observed_at":"2026-07-12T11:49:31.618283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.27538","last_updated":"2026-06-25T20:39:26Z","snapshot_observed_at":"2026-08-16T14:44:12.662461Z","submitted_at":"2026-06-25T20:39:26Z","title":"The Context-Ready Transformer","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-29T01:59:43.093422Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.27538"},"observation_digest":"sha256:84f56f41c9f3c97098d2558cb5965fb4f99be32123ea15e70049b910e88d7323","observation_id":"4c34e4da-8684-491b-b038-bd17202c16f6","resolution":{"observed_at":"2026-07-01T18:25:58.296712Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.19427/citation-record","integrity":"/paper/2402.19427/integrity","json":"/paper/2402.19427/citation-record.json","paper":"/paper/2402.19427"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:4ef75383c21172bbce54af2310ff1e8f251104f8c93fd1de2a417687dd4ecaae","observation_id":"87cf6716-212c-4ad6-9893-b3cc7fb964fc","resolution":{"observed_at":"2026-05-15T06:58:17.404105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-18T01:44:19.597420Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":"1409.0473","doi":"10.48550/arxiv.1409.0473","metadata_source":"pith","pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","venue":"cs.CL","work_id":"d831e763-d530-4029-a65c-ac595d82cb2a","year":2014},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:9c89f0a79b908f66bb3b4d4c8a7684afc0a89e3740d42b370d41ae6eef94a94e","observation_id":"09c0fc6e-96a3-46af-bd4f-7379ef746ff6","resolution":{"observed_at":"2026-05-15T06:58:17.411532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:b5fb0a42668a97e8de2ff68c173a1fbe4daab2836542b52ba6f72862c7c90b1b","observation_id":"3159a262-5e7d-4778-98d0-e2f5f701be8f","resolution":{"observed_at":"2026-05-15T06:58:17.418193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01576","last_updated":"2016-11-21T20:52:34Z","snapshot_observed_at":"2026-08-14T21:31:52.199034Z","submitted_at":"2016-11-05T00:31:25Z","title":"Quasi-Recurrent Neural Networks","version":2},"cited_work":{"arxiv_id":"1611.01576","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.01576","snapshot_observed_at":"2026-07-04T03:29:29.390096Z","title":"Quasi-Recurrent Neural Networks","venue":"cs.NE","work_id":"a3b3168b-5ab0-4a88-9e57-969e93933291","year":2016},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1611.01576","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:d5f3f8dd2944631b4450646ed58ecda5019a01f07e9451b7b820e09d4fdc4caf","observation_id":"1eec6377-7683-443d-900a-c9ea21c084a4","resolution":{"observed_at":"2026-05-15T06:58:17.423878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T.Brown,B.Mann,N.Ryder,M.Subbiah,J.D.Kaplan,P.Dhariwal,A.Neelakantan,P.Shyam,G.Sastry, A","venue":null,"work_id":"c7454809-842f-4823-bba3-768ab6263ede","year":1901},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:f24160c72f101678183c9ede00c429c92c89decc79cbcb04ed518ac44ad99409","observation_id":"2318a795-c3f2-4416-a960-ba6f7c47c756","resolution":{"observed_at":"2026-05-15T06:58:17.614165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:f741140b797b410eb8e4ddefd6cea5d2fe5587329acfb927e24b930cb7466d22","observation_id":"c33bcbbb-ef9b-4a3e-9f87-9d6a57a05915","resolution":{"observed_at":"2026-05-15T06:58:17.469338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-13T10:35:27.214652Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":"1412.3555","doi":"10.1145/2939672.2939875","metadata_source":"pith","pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","venue":"cs.NE","work_id":"c7f2f5a9-ae4b-48db-aff0-24b9d0528995","year":2014},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:69d719fa3f69ac47edc1034a527561e44358e84cb297fec0f98d939e0fe16ac0","observation_id":"55ee1edb-eb88-4c0f-8c5f-98566dd9df0f","resolution":{"observed_at":"2026-05-15T06:58:17.474817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-19T20:22:37.170537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T20:22:37.170537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-08-16T16:05:36.333895Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":"2212.14052","doi":"10.48550/arxiv.2212.14052","metadata_source":"pith","pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hungry hungry hippos: To- wards language modeling with state space models","venue":"cs.LG","work_id":"d5653b0c-f12c-4141-9343-d65df1fb4214","year":2022},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:59f6bbb662b8dd64c18ff59168e08f92be09705464794cfe81a7f03f592f1e1e","observation_id":"5b5c40d6-e234-4fdd-b727-9b7e275ac8ae","resolution":{"observed_at":"2026-05-15T06:58:17.482210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:ecca911a62aca745ab1761f020f0e5c812cc918341499df732706d13cb0deed5","observation_id":"6e4486d7-ce5c-4c22-a8db-ec209bdd790c","resolution":{"observed_at":"2026-05-15T06:58:17.488268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:46ad903c515a2c19d0cfaa3b40dd273712bd0578499fc0e8c0136b76fb252db3","observation_id":"e19687ef-b041-4cc8-a9c0-99459888b257","resolution":{"observed_at":"2026-05-15T06:58:17.494676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:14.544227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:14.544227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":"2111.00396","doi":"10.48550/arxiv.2111.00396","metadata_source":"pith","pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","venue":"cs.LG","work_id":"4150b761-b8bf-4d9b-a2f8-cb2d1b73d378","year":2021},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:4a27b20b2b200f11483363461d1eb9e830769fc7deec45e7bcb7b4f04b62f3ca","observation_id":"4ff28c73-b19e-4a42-946a-cbcbaebd3c2c","resolution":{"observed_at":"2026-05-15T06:58:17.501302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:0e2379a672bf22234b48f997cef544aeb60bd09c391803cf1a7d078f9b6e988f","observation_id":"0d3ed0ee-309d-4b95-afe4-dfd78e21c628","resolution":{"observed_at":"2026-05-15T06:58:17.507685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:b6b4d8f73edee9b02ed2779beaabd4b54cc6b8ea3bb4462dd1b9c884309920c1","observation_id":"88e56c38-da17-4c57-9681-d19afd23902e","resolution":{"observed_at":"2026-05-15T06:58:17.513427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-16T14:22:19.962526Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:48a60a1b110a5f4745bdc6e5a62118b1308e14711c503ecacc875a54856bafac","observation_id":"4785e0e2-ffce-4e15-87fe-1fa1c43050d1","resolution":{"observed_at":"2026-05-15T06:58:17.519265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:f892b68e21e7a475cef99401066b74cb1bd0ca1abaebb165efbd78646b238b29","observation_id":"df4db80d-37ac-4ded-a8b4-632fe1c177d5","resolution":{"observed_at":"2026-05-15T06:58:17.525125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T22:08:12.954417+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T22:08:12.954417+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9b4c321-511c-4137-bdda-b1f1ad06384c","year":2021},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:a317fb3012663883f08a69248376db96bf625181e8689f9e133bf49bbd53eba7","observation_id":"4d88dc55-0d64-41e8-97b3-4810ca6b7ef9","resolution":{"observed_at":"2026-05-15T06:58:17.617708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:c56d4619a0a33650839fa19aeaa0894475c5f60cc7218372c20e10d1d76855f5","observation_id":"79320dd5-00a0-45de-9a30-1e04cd95b9ee","resolution":{"observed_at":"2026-05-15T06:58:17.532642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01927","last_updated":"2024-01-27T14:52:52Z","snapshot_observed_at":"2026-08-16T14:46:12.885151Z","submitted_at":"2023-11-03T14:08:39Z","title":"GateLoop: Fully Data-Controlled Linear Recurrence for Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2311.01927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01927","snapshot_observed_at":"2026-07-04T16:09:56.603945Z","title":"arXiv preprint arXiv:2311.01927 , year=","venue":null,"work_id":"cdb0303e-f9ec-4458-b713-3f9cdb276f3d","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2311.01927","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:0e663d94a3831aca17635773538872cc3ca1189ec3d19553e8a72208ef12dbb1","observation_id":"2e74e5b8-18d7-4c59-85a4-db39883f2d70","resolution":{"observed_at":"2026-05-15T06:58:17.539189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems,36","venue":null,"work_id":"3a04adc5-57b9-44ee-ad52-eac2416f4a52","year":2024},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:b8d44c58ce731cc1a133e4226d09b566849a19222e82bbbe259d7333f3233937","observation_id":"d642502c-c943-4d42-a12d-22b4c622f805","resolution":{"observed_at":"2026-05-15T06:58:17.629689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:5419274c141546a576c5b162458e7667d44e94398082b1aeb992c012bab8a189","observation_id":"92df91aa-32dc-4d4b-ab6a-87b2f27590c3","resolution":{"observed_at":"2026-05-15T06:58:17.544914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.04057","last_updated":"2018-02-22T05:38:25Z","snapshot_observed_at":"2026-08-16T05:42:54.822436Z","submitted_at":"2017-09-12T20:52:22Z","title":"Parallelizing Linear Recurrent Neural Nets Over Sequence Length","version":2},"cited_work":{"arxiv_id":"1709.04057","doi":"10.5281/zenodo.15006","metadata_source":"pith","pith_arxiv_id":"1709.04057","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Parallelizing Linear Recurrent Neural Nets Over Sequence Length","venue":"cs.NE","work_id":"b5e6c977-9348-46af-80c6-1080731af384","year":2017},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1709.04057","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:f1759d5fcd370cba974413f759ba6e656f586b2eaf808f0b5e1eafce834f1ce6","observation_id":"5faca210-37cd-46fe-b80f-67a2fe77813a","resolution":{"observed_at":"2026-05-15T06:58:17.550241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13947","last_updated":"2022-07-02T17:58:04Z","snapshot_observed_at":"2026-08-16T16:50:15.793766Z","submitted_at":"2022-06-27T01:50:18Z","title":"Long Range Language Modeling via Gated State Spaces","version":3},"cited_work":{"arxiv_id":"2206.13947","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.13947","snapshot_observed_at":"2026-07-04T03:39:29.518555Z","title":"Long range language modeling via gated state spaces","venue":null,"work_id":"0b23bcdd-3ee6-4ccf-80d6-77ad13380655","year":2022},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2206.13947","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:0375b5783688474d013a1bbc2dbfa6f476245b0bd0c620a379fe0379dd257bc3","observation_id":"6a8aa7f5-c97c-4e5a-bd25-04adefc0fc7c","resolution":{"observed_at":"2026-05-15T06:58:17.555498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11888","last_updated":"2024-06-05T10:00:40Z","snapshot_observed_at":"2026-08-16T15:14:13.716102Z","submitted_at":"2023-07-21T20:09:06Z","title":"Universality of Linear Recurrences Followed by Non-linear Projections: Finite-Width Guarantees and Benefits of Complex Eigenvalues","version":3},"cited_work":{"arxiv_id":"2307.11888","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11888","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orvieto, S","venue":null,"work_id":"80da037d-01c2-47f7-9d78-dc65f41a3b2e","year":null},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2307.11888","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:a84362862752fb036086c799f29c1ade97a95b2e3dcaecb5c92bf96ae63e56d5","observation_id":"f6b4b095-2935-4e4d-bbdd-fd1421e6287c","resolution":{"observed_at":"2026-05-15T06:58:17.560747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10866","last_updated":"2023-04-19T20:08:39Z","snapshot_observed_at":"2026-08-16T15:53:46.019050Z","submitted_at":"2023-02-21T18:29:25Z","title":"Hyena Hierarchy: Towards Larger Convolutional Language Models","version":3},"cited_work":{"arxiv_id":"2302.10866","doi":"10.48550/arxiv.2302.10866","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.10866","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fu, Tri Dao, Stephen Baccus, Yoshua Bengio, Stefano Ermon, and Christopher Ré","venue":"arXiv (Cornell University)","work_id":"d2a9f7d7-e301-4371-95ad-55f6ca1ef4c5","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2302.10866","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:1e511d69112596ecde3384545faa51466801055c65e780649e5bcac677140e0e","observation_id":"18c879ba-ebab-48c9-b250-077258870c42","resolution":{"observed_at":"2026-05-15T06:58:17.566956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:ec7da882c70b1bbf6eae6e482862939c9b09ab44ce166233df3165976a259bf7","observation_id":"992899c5-c7d4-46d2-8001-8d4a8435d8cd","resolution":{"observed_at":"2026-05-15T06:58:17.573112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:0870acda6c3389db8de680c577780e485d4957eb187d712d5c4c4697c9c54297","observation_id":"8850c0a0-df23-4695-b680-4f56978a3535","resolution":{"observed_at":"2026-05-15T06:58:17.578807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:9f910423a9fa4791bbd9d9d2c91e30208656408ae43a17d17722090d0cd76fd5","observation_id":"790bdada-5db6-472b-a1e9-83e7d0303380","resolution":{"observed_at":"2026-05-15T06:58:17.583949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:f3e060fead95e411e9de7eb011ec1ec351628862fdd4f2cc5792de5af9fa2634","observation_id":"3ff9f499-89a9-46ad-9ed4-a3bdf03cfa41","resolution":{"observed_at":"2026-05-15T06:58:17.592017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-08-13T08:14:01.416880Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":"2208.04933","doi":"10.48550/arxiv.2208.04933","metadata_source":"pith","pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simplified State Space Layers for Sequence Modeling","venue":"cs.LG","work_id":"d4f90830-6ceb-4c9e-b206-eb32ac063f45","year":2022},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:ea492d41e961205ce88d0baefbeeea899ab6928b95c1f8cf7ccc314a5d46b050","observation_id":"73b1b397-82a6-4ed8-9f81-2f94adb8ff41","resolution":{"observed_at":"2026-05-16T08:16:11.899530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:9d6ec225442cdccc821cf7b2d60a82988e40487f99bdb091a516a9c23dc12e96","observation_id":"275ae357-f483-4b42-a1b2-b4e2a2ec6245","resolution":{"observed_at":"2026-05-15T06:58:17.603924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:6e793d865440eca6c4628e1c3ebb7b97c122cdaf1fbbaf403a3054da2f442467","observation_id":"f3a76fb5-52a8-4a4c-9ab1-75af503ea322","resolution":{"observed_at":"2026-05-15T06:58:17.609791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-08-16T19:07:23.144895Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":"2011.04006","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-07-04T03:29:29.405310Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":"ea19357f-7ac8-485e-a184-a8a0452e44d2","year":2011},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:33d44c40cab022c7435c9a67fe117d5a2738830ed7b0402e503a82f56e59ad3a","observation_id":"9c1fdd02-67de-4fbd-b50f-4c9d2e9dc6a2","resolution":{"observed_at":"2026-05-15T06:58:17.429964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:a27cb41b408d579888bbfc4a9a4586dd659caf7088469f5297550767212871c0","observation_id":"baa54c77-d192-4123-9937-305d4535e876","resolution":{"observed_at":"2026-05-15T06:58:17.435569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13660","last_updated":"2024-08-09T20:18:57Z","snapshot_observed_at":"2026-08-18T01:06:50.520785Z","submitted_at":"2024-01-24T18:53:53Z","title":"MambaByte: Token-free Selective State Space Model","version":3},"cited_work":{"arxiv_id":"2401.13660","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13660","snapshot_observed_at":"2026-07-03T12:48:11.761335Z","title":"N., and Rush, A","venue":null,"work_id":"7408d5c4-b707-4822-a8dd-a52f418b53d6","year":2024},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2401.13660","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:f68f6ec2e85577b6d2fb71382a07478d9cb9cf00969ab9a1199254f0a366abfc","observation_id":"eedd0109-dc5b-4176-964b-d1704c146855","resolution":{"observed_at":"2026-05-15T06:58:17.441699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":"1609.08144","doi":"10.18653/v1/2021.eacl-main.163","metadata_source":"pith","pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","venue":"cs.CL","work_id":"e294e5a1-5dd2-44a0-b348-adbd62fe1916","year":2016},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:d514a3151fa6ac41677a020d55e7c9bc38d6f368bc275be7dc1ee27e98965f4f","observation_id":"61b73720-64f8-4586-9849-e616c6cf35f9","resolution":{"observed_at":"2026-05-15T06:58:17.450878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14103","last_updated":"2021-09-21T18:04:55Z","snapshot_observed_at":"2026-08-16T18:21:21.019790Z","submitted_at":"2021-05-28T20:45:30Z","title":"An Attention Free Transformer","version":2},"cited_work":{"arxiv_id":"2105.14103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.14103","snapshot_observed_at":"2026-07-04T10:29:45.024670Z","title":"An attention free transformer","venue":null,"work_id":"49358264-ed48-4ca7-9326-d1365796f89a","year":2021},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2105.14103","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:7e1e43b9bfc4a3cbf215d091eccbcf8530d09972a77c67b4b2d8f3c3c9bbe970","observation_id":"9073705e-3dfd-4def-a342-4df21a38486d","resolution":{"observed_at":"2026-05-15T06:58:17.456663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-08-14T11:12:31.002605Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":"2401.09417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-07-04T19:30:07.531920Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","venue":"cs.CV","work_id":"bd81352e-a64f-4720-9f76-ddda0ea9af83","year":2024},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:8e010e6d768a38fee19db4520bda59050f65939fd8cd6383a41a3a5610192ac7","observation_id":"2c6f7f69-0934-4197-bfbc-f9f3fd7320ec","resolution":{"observed_at":"2026-05-15T06:58:17.463618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(13) We mark all complex variables with˜·for clarity","venue":null,"work_id":"f8ca43d8-ed10-4b11-8214-51afc1b25c6d","year":2048},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:00041d29a8e90e32225ef444770be31980be59400ffb1b1fbdc63c709d64ee74","observation_id":"826ca3f4-8586-499a-ab66-85fae5056b78","resolution":{"observed_at":"2026-05-15T06:58:17.634022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"566b9347-099d-486d-a9d4-7959f87ee549","year":2048},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:21d91a2034c21e89a58bcf81e9be73189c01815a8ae3620f4e553e2e40ec57be","observation_id":"69dcc9dd-59ff-4712-a0e5-dec63b133fad","resolution":{"observed_at":"2026-05-15T06:58:17.621278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the left, we compare the performance of different models trained with sequence length 2048, evaluated with a sequence length of up to 32,768","venue":null,"work_id":"82de470c-6d3d-426e-a347-520534048517","year":2048},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:c2f44ad4e1ed2f759c3bd8ae85819508f224f16251292d8f06bb5e39ad47510f","observation_id":"9cf9927a-fe44-4c45-9151-5c9b99f03a47","resolution":{"observed_at":"2026-05-15T06:58:17.625874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":34,"verified_fuzzy":4},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 100 inbound Pith citation observations for arXiv:2402.19427."}