{"as_of":"2026-08-08T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d973b3f1e9a83e3fd838e3e593b1174d465c1b94611e0e4fc74793ddbaeab737","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:48.233553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T12:46:14.661055Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-07T11:26:24.987920Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-05-12T09:16:14.336570Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2009.14794"},"observation_digest":"sha256:b3f06b74a60d70c32acd4b33d15a11e0c04a30d6de2cd2a4b7322ee070eadca0","observation_id":"74099416-bc4c-4426-9e04-32e38ec29945","resolution":{"observed_at":"2026-05-12T09:16:14.479854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T09:47:16.915936Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2010.04159"},"observation_digest":"sha256:2527dbc4fff2cf9aadcb1736decc683d1098d8b4f6f0171fab2fd14e3bc6a682","observation_id":"82f2ab52-4f6a-4bb0-a2c0-0c48c08e9616","resolution":{"observed_at":"2026-05-11T09:47:16.992761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-07T14:44:48.233553Z","title":"Jack Kiefer and Jacob Wolfowitz","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.17852","last_updated":"2025-05-23T13:04:06Z","snapshot_observed_at":"2026-08-07T14:37:24.369597Z","submitted_at":"2025-05-23T13:04:06Z","title":"Scaling Recurrent Neural Networks to a Billion Parameters with Zero-Order Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:48.233553Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2505.17852"},"observation_digest":"sha256:fa8eea31e50e3acd4004666702b051cee06cae20b681de27ada7964b09375121","observation_id":"452e639c-9a53-41c3-9be9-ab3616972d59","resolution":{"observed_at":"2026-08-07T14:44:48.233553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-07T06:10:18.920713Z","title":"Transformers are RNNs : Fast Autoregressive Transformers with Linear Attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06179","last_updated":"2025-06-06T15:44:10Z","snapshot_observed_at":"2026-08-07T08:23:24.866121Z","submitted_at":"2025-06-06T15:44:10Z","title":"A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:10:18.920713Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2506.06179"},"observation_digest":"sha256:512c4ee2e77069867a9dfe50fe609673c905811a2be7c3379a0a91e0bba6ed54","observation_id":"690e44ed-757d-411e-868e-ae61c42ee29c","resolution":{"observed_at":"2026-08-07T06:10:18.920713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-07T04:46:03.218234Z","title":"Transformers are RNNs : Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.01022","last_updated":"2025-06-11T13:07:47Z","snapshot_observed_at":"2026-08-08T06:01:20.735934Z","submitted_at":"2025-06-11T13:07:47Z","title":"Workflow-Based Evaluation of Music Generation Systems","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T04:46:03.218234Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2507.01022"},"observation_digest":"sha256:80840087d0d6d84c64797b576ce14faf385ee67d2faefc9c18032c6506108a48","observation_id":"bdde8bfd-24b9-4bf4-a1df-1c67f13f95ed","resolution":{"observed_at":"2026-08-07T04:46:03.218234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-06T20:00:43.755014Z","title":"Katharopoulos, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-06T19:50:11.930983Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.755014Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:4e242c0b7cac0f29cdae8aa55bcdb842f3b40e9d6c68e2f99684e35577110829","observation_id":"0f3f5402-67c2-40bd-8261-d2e154e12313","resolution":{"observed_at":"2026-08-06T20:00:43.755014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-05T23:41:56.616058Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05028","last_updated":"2025-08-18T01:10:45Z","snapshot_observed_at":"2026-08-08T09:20:38.458022Z","submitted_at":"2025-08-07T04:43:47Z","title":"Evaluation of Finetuned LLMs in AMR Parsing","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:56.616058Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2508.05028"},"observation_digest":"sha256:2d55c366acecb580cedef9927565119a4f88c171dddb6ccbaf5d9d768abd3445","observation_id":"3bb37966-500c-4234-9637-c71ec7576f63","resolution":{"observed_at":"2026-08-05T23:41:56.616058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-05T15:10:54.569448Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, August 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20407","last_updated":"2025-08-28T04:10:19Z","snapshot_observed_at":"2026-08-07T22:03:05.552719Z","submitted_at":"2025-08-28T04:10:19Z","title":"Rethinking Transformer Connectivity: TLinFormer, A Path to Exact, Full Context-Aware Linear Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:54.569448Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2508.20407"},"observation_digest":"sha256:1507a0680661c39c3910ca7885842b06a1b807ff64603550ac76e2e2769ce234","observation_id":"86678972-059a-4d82-8ab9-b98aec955c35","resolution":{"observed_at":"2026-08-05T15:10:54.569448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-05T14:36:37.597579Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.21153","last_updated":"2025-08-28T18:38:42Z","snapshot_observed_at":"2026-08-07T14:49:09.772290Z","submitted_at":"2025-08-28T18:38:42Z","title":"WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:36:37.597579Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2508.21153"},"observation_digest":"sha256:a7c6f772108c84149a930de616ab3887c51e4e669071b51870a6f187be1121bf","observation_id":"a73fd013-e27c-48c0-b678-fbb90b355fa2","resolution":{"observed_at":"2026-08-05T14:36:37.597579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2509.04154","last_updated":"2026-07-16T05:43:33Z","snapshot_observed_at":"2026-08-05T10:25:10.943738Z","submitted_at":"2025-09-04T12:29:14Z","title":"Robust Filter Attention: Self-Attention as Precision-Weighted State Estimation","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T18:56:48.722344Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2509.04154"},"observation_digest":"sha256:c1e7e0db9ae02a03a5e27f3ee6239874bb6cce748af647e778e4ea448c3f742a","observation_id":"1fc59587-a1bb-4feb-83d2-473b16bbe591","resolution":{"observed_at":"2026-05-18T19:01:46.263295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-05T10:25:17.118921Z","title":"Transformers are RNNs : Fast autoregressive Transformers with linear attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04154","last_updated":"2026-07-16T05:43:33Z","snapshot_observed_at":"2026-08-05T10:25:10.943738Z","submitted_at":"2025-09-04T12:29:14Z","title":"Robust Filter Attention: Self-Attention as Precision-Weighted State Estimation","version":9},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T10:25:17.118921Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2509.04154"},"observation_digest":"sha256:06c57b64a1dc79325703b06281ae173e68278e3ea30124d018fea2d0bebebd97","observation_id":"e4c0e263-a0fa-4f17-bb7c-73acf485a3d0","resolution":{"observed_at":"2026-08-05T10:25:17.118921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-04T21:33:57.271806Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.07963","last_updated":"2026-06-02T19:48:10Z","snapshot_observed_at":"2026-08-06T19:53:55.837139Z","submitted_at":"2025-09-09T17:50:58Z","title":"Customizing the Inductive Biases of Softmax Attention using Structured Matrices","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T21:33:57.271806Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2509.07963"},"observation_digest":"sha256:b1ff5307e9594c550a6289d7c5f09dae293a3076d30975665c8639e802ff2c73","observation_id":"dc923eb5-9062-4833-a75c-873c904a5a86","resolution":{"observed_at":"2026-08-04T21:33:57.271806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-04T16:52:10.872577Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11259","last_updated":"2026-07-06T06:45:46Z","snapshot_observed_at":"2026-08-04T16:52:08.392813Z","submitted_at":"2025-09-14T13:09:58Z","title":"ICR-RL: Deep Reinforcement Learning via In-Context Regression","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T16:52:10.872577Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2509.11259"},"observation_digest":"sha256:95ae8eaead030ee80c9c0203674789214c14dfb61124492810fefc82157873ae","observation_id":"75d6ce3f-96e3-4551-be7f-a37e1bbe9aec","resolution":{"observed_at":"2026-08-04T16:52:10.872577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2509.22630","last_updated":"2026-04-24T05:03:12Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:55:22Z","title":"StateX: Enhancing RNN Recall via Post-training State Expansion","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T12:27:06.616920Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2509.22630"},"observation_digest":"sha256:a06ce5d50e5db1251023809eab251b7388d390298f962e1d73f8f7f509290d8a","observation_id":"c1be79be-413b-4704-80ab-10ba0ff07d92","resolution":{"observed_at":"2026-05-18T12:31:22.164668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2509.24552","last_updated":"2026-05-04T14:21:45Z","snapshot_observed_at":"2026-08-02T23:01:03.041288Z","submitted_at":"2025-09-29T10:04:12Z","title":"Short window attention enables long-term memorization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T12:10:42.646127Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2509.24552"},"observation_digest":"sha256:2800690619db1e9463fd54f05edd31adb22a3404a469f840aabdcf9df2e9f1fc","observation_id":"89ba6797-f20c-4158-8323-acfd73e12373","resolution":{"observed_at":"2026-05-18T12:11:21.778307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-04T08:12:25.317841Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.22052","last_updated":"2026-07-09T14:33:48Z","snapshot_observed_at":"2026-08-08T12:44:25.816252Z","submitted_at":"2025-10-24T22:21:08Z","title":"A Vision Toward Energy-Efficient Domain-Specific Artificial Intelligence Models and Agents","version":2},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:25.317841Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2510.22052"},"observation_digest":"sha256:beeb559119605ee13daaa5909a2c0eedf5fa0592da8244e7cf9ddf650714988f","observation_id":"fe1ba79f-ba64-42de-9f3d-ec744f5954ce","resolution":{"observed_at":"2026-08-04T08:12:25.317841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-08-07T14:13:20.121484Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:085ec2832f6ba0643ea75c3290dd977378e9e14abc28e67c98fee0eabeba302e","observation_id":"98d884bb-8b89-4086-8f2f-2462390adace","resolution":{"observed_at":"2026-05-18T01:40:42.558358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-03T10:26:02.691384Z","title":"Transformers are RNNs: Fast autoregressive transform- ers with linear attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.10221","last_updated":"2026-08-03T04:47:07Z","snapshot_observed_at":"2026-08-07T10:01:01.598197Z","submitted_at":"2026-01-15T09:34:50Z","title":"Cognitive Field Theory: Memory-Dressed Collective Dynamics of Intelligence","version":7},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T10:26:02.691384Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2601.10221"},"observation_digest":"sha256:9a98a5cbc5a36279ac08ba86edc51842cbc618407c6b41f5964c9f8da5a03819","observation_id":"372e6283-b3cc-434a-99f4-efe62bdcfd4d","resolution":{"observed_at":"2026-08-03T10:26:02.691384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-04T06:26:45.132747Z","title":"Transformers are RNNs: Fast autoregressive transform- ers with linear attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.10221","last_updated":"2026-08-03T04:47:07Z","snapshot_observed_at":"2026-08-07T10:01:01.598197Z","submitted_at":"2026-01-15T09:34:50Z","title":"Cognitive Field Theory: Memory-Dressed Collective Dynamics of Intelligence","version":8},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T06:26:45.132747Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2601.10221"},"observation_digest":"sha256:4c99a72ce77acf42c18bb7b9a1c4327ab9699312e954abdc59d717eea51f8fbc","observation_id":"f614d458-3e98-496e-be91-63003e45d623","resolution":{"observed_at":"2026-08-04T06:26:45.132747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2601.14053","last_updated":"2026-04-16T15:26:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T15:06:19Z","title":"LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T12:47:28.248540Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2601.14053"},"observation_digest":"sha256:d59a4aacce14f1b82ee39bb95f28e11f635c7bdc25befffcb37ceed1e10c9525","observation_id":"feb237d2-3086-40df-b318-b6efd50a617a","resolution":{"observed_at":"2026-05-16T12:47:53.817204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-02T21:52:58.267170Z","title":"org/abs/2006.16236","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.18955","last_updated":"2026-06-03T21:26:24Z","snapshot_observed_at":"2026-08-08T11:44:36.859291Z","submitted_at":"2026-02-21T20:30:04Z","title":"Incremental Transformer Neural Processes","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T21:52:58.267170Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2602.18955"},"observation_digest":"sha256:4af17c3a8b31ac2f440b98fd613517650ea3c670456b6c29ac04b02f6bf94a2d","observation_id":"5224929e-12c7-44a6-9940-3a857b103342","resolution":{"observed_at":"2026-08-02T21:52:58.267170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2604.06169","last_updated":"2026-04-07T17:59:44Z","snapshot_observed_at":"2026-08-03T02:43:13.230039Z","submitted_at":"2026-04-07T17:59:44Z","title":"In-Place Test-Time Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:47.174513Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2604.06169"},"observation_digest":"sha256:f4b08f09740d9c64d1e86ea716fd4a1194b4600c78666c5fb98afd0db8e400e9","observation_id":"0ad0c30e-27f8-46fa-9004-c7da7b492dcf","resolution":{"observed_at":"2026-05-10T23:30:49.133097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2604.22442","last_updated":"2026-04-24T10:59:30Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T10:59:30Z","title":"HubRouter: A Pluggable Sub-Quadratic Routing Primitive for Hybrid Sequence Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T12:21:07.816749Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2604.22442"},"observation_digest":"sha256:f62e9d74e1347297fe145f8608b2c7951ff7f596280b780659edbc9ecbd3d33d","observation_id":"95506fcd-ebda-4eca-8e53-877137fdf0f2","resolution":{"observed_at":"2026-05-11T19:16:09.990965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.02568","last_updated":"2026-05-04T13:19:29Z","snapshot_observed_at":"2026-07-31T19:18:10.074012Z","submitted_at":"2026-05-04T13:19:29Z","title":"StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T18:44:42.456111Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.02568"},"observation_digest":"sha256:185dc4db5488eca11d40a23cd3efce2d8d03d3a007d4fe26a169a595d4121340","observation_id":"44e7b85b-b778-4144-80a9-53ec2be4fbc4","resolution":{"observed_at":"2026-05-09T06:15:37.711744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.05806","last_updated":"2026-05-08T05:21:54Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:42:28Z","title":"Retrieval from Within: An Intrinsic Capability of Attention-Based Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T14:44:21.325977Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.05806"},"observation_digest":"sha256:4a6e74cea4f46e8eb2836037dab9c924f80c2c3e8eb84bc66a65b7ab92a78964","observation_id":"c1486958-4903-46f8-8d34-7679d9c5caf1","resolution":{"observed_at":"2026-05-11T18:41:10.635190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.05806","last_updated":"2026-05-08T05:21:54Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:42:28Z","title":"Retrieval from Within: An Intrinsic Capability of Attention-Based Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:03:11.473175Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.05806"},"observation_digest":"sha256:209b3282eab7dde5d8eba10a1cbc353a6ec83f91b42fe962585e213ef339cb9a","observation_id":"2d816f37-efa7-404c-a93f-0281000c4b3c","resolution":{"observed_at":"2026-05-11T04:50:55.309782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.06683","last_updated":"2026-04-24T20:37:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-24T20:37:21Z","title":"Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-11T01:07:33.756985Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.06683"},"observation_digest":"sha256:5b935a0cafec7d23cefa36b3de0ce1fea698e7c8d27f25a57f50b2c3d4ae9422","observation_id":"1041b59f-9f5b-40b3-8c6a-165793753671","resolution":{"observed_at":"2026-05-11T04:45:56.466340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-06T23:11:17.515488Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T01:28:46.885635Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:5686b86f9c779dd71db3748f9e6aa49681a5438bf57b28f4b45d3f68d4106f5b","observation_id":"b0ad838b-8623-4a0d-afd0-dde5e28996e3","resolution":{"observed_at":"2026-05-12T07:56:29.292952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-06T23:11:17.515488Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-20T23:27:20.754475Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:1cdbd4a60df836aa467b509f054d563c759f1321fc8d7a9326a977754257202f","observation_id":"c74920c1-f39e-426f-84ce-902cbfd4bd0d","resolution":{"observed_at":"2026-05-20T23:29:12.972639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-06T23:11:17.515488Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-30T23:31:48.469869Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:c0ba0e001406b748095f68563ee91fb2f606f02d3cf8eb46c070d627fe934168","observation_id":"a2934cc9-9055-475b-b918-c756437d2c85","resolution":{"observed_at":"2026-06-30T23:35:07.328572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-04T05:19:07.886621Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-06T23:11:17.515488Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T05:19:07.886621Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:52429d43ab82a0690d8c29bac7db3a9d7fb33ba00f02b7b91c0215ea561ec5af","observation_id":"49206b55-4541-4c99-a12f-9a4f69f3c6e4","resolution":{"observed_at":"2026-08-04T05:19:07.886621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.11007","last_updated":"2026-08-02T03:28:25Z","snapshot_observed_at":"2026-08-06T23:24:39.977969Z","submitted_at":"2026-05-10T08:14:14Z","title":"The Transformer as a Polar State Estimator","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T00:58:28.483037Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.11007"},"observation_digest":"sha256:936cf94602a1ff52187b7db417fc50530c135a4b42711c3ddb7a0d41c9d2cfff","observation_id":"979b1979-1bfe-4872-bbdd-0712130f9f03","resolution":{"observed_at":"2026-05-13T02:17:07.442265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-14T20:53:40.666929Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:89b10d216d141b09e8863e4a5f7c3ae342d6aa8932e53687210b70f0ff4c03b9","observation_id":"e0ff97c4-7f37-4d57-837f-98a0fd7ae4ff","resolution":{"observed_at":"2026-05-14T20:59:28.589590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-15T04:59:11.877068Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:aaf86857c0fb67d2c36826da8353f015711eacc445cb1db176db150a3bf43d9a","observation_id":"8f212a8b-c846-440c-b1f9-1774a1ca34ee","resolution":{"observed_at":"2026-05-15T04:59:45.116299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2605.13262","last_updated":"2026-05-13T09:43:55Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:43:55Z","title":"Chem-GMNet: A Sphere-Native Geometric Transformer for Molecular Property Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:19.362468Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2605.13262"},"observation_digest":"sha256:1122abfd9da3c42fc03a901ecd4dd23ffbe7bc9877d2ce014b41d223fa22008c","observation_id":"6d9076f4-5a6d-40b3-a227-784424cee5be","resolution":{"observed_at":"2026-05-14T19:57:53.690756Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2606.07317","last_updated":"2026-06-08T08:58:58Z","snapshot_observed_at":"2026-08-03T01:41:20.836170Z","submitted_at":"2026-06-05T14:37:02Z","title":"Gated Bidirectional Linear Attention for Generative Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T20:38:01.086990Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2606.07317"},"observation_digest":"sha256:dcedf82f08357ec7c548b8c7470f6fadba1412dcb51eb3930d1ef01716ea86c3","observation_id":"41117b28-8a1a-4c7f-a2f2-edc4a13faa1d","resolution":{"observed_at":"2026-07-02T20:17:22.286657Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2606.08804","last_updated":"2026-06-07T19:49:01Z","snapshot_observed_at":"2026-08-04T14:57:16.793688Z","submitted_at":"2026-06-07T19:49:01Z","title":"Q-Delta: Beyond Key-Value Associative State Evolution","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T18:30:51.523567Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2606.08804"},"observation_digest":"sha256:07e88e9b642dcca59d2e05e00bf02af4d248ea56c58bd151220ba4f6773d8d79","observation_id":"456d36a7-be50-4ce9-ab82-4597bfabc4cf","resolution":{"observed_at":"2026-07-02T23:07:26.570441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:57.030469Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:84729c84ab94f0549cc8887b4b8a175a70bab7753a7640a7e69147a1fe72ad63","observation_id":"0788782e-4c80-46fd-83ab-6b9d27bf5e06","resolution":{"observed_at":"2026-06-30T09:54:35.230604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-13T07:16:45.194991Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention.https://arxiv.org/abs/2006.16236, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T07:16:45.194991Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:769d34a9603db2bd3024591068b0ac3b13d1e6bbf4e2254c50c4d5a271b920a5","observation_id":"19276440-1143-4da1-8f1b-413239946bf5","resolution":{"observed_at":"2026-07-13T07:16:45.194991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2607.02303","last_updated":"2026-07-02T15:19:49Z","snapshot_observed_at":"2026-07-07T00:07:47.719699Z","submitted_at":"2026-07-02T15:19:49Z","title":"A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-03T13:46:18.862925Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2607.02303"},"observation_digest":"sha256:e1d78bddf7b5b128c9b9bee3195d56ff8d6c07794b58bfbfa1bd8637cda22acd","observation_id":"2a52627a-b295-4603-943a-ad2e1b5adc5d","resolution":{"observed_at":"2026-07-03T13:48:20.302560Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-12T00:55:09.690245Z","title":"https://doi.org/10.48550/ARXIV.2006.16236","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.03652","last_updated":"2026-07-04T00:52:06Z","snapshot_observed_at":"2026-08-07T04:49:22.708900Z","submitted_at":"2026-07-04T00:52:06Z","title":"ELiTeFormer: An Efficient Transformer for FPGAs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:55:09.690245Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2607.03652"},"observation_digest":"sha256:96d73676054bd68f5a6d396262e90a1bb6dea4c5845c96a3cb4ce34a9935a90c","observation_id":"232e1d56-7592-4206-a07f-1c052c404ee7","resolution":{"observed_at":"2026-07-12T00:55:09.690245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":"2006.16236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-09T12:46:14.661055Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"cs.LG","work_id":"39bd8560-a1db-4b70-bbf8-9ccb6067af8a","year":2020},"citing_paper":{"arxiv_id":"2607.07386","last_updated":"2026-07-08T13:17:19Z","snapshot_observed_at":"2026-08-06T16:46:55.298935Z","submitted_at":"2026-07-08T13:17:19Z","title":"Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-09T12:40:09.036905Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2607.07386"},"observation_digest":"sha256:3c5cfb96ffa3c9f87aa5268c3722d7b73f4ba1adfec2da6a399cc30d1389ce6e","observation_id":"5254e790-91d8-4e3b-af19-0a9d309e51ec","resolution":{"observed_at":"2026-07-09T12:46:14.662427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-07-14T08:17:20.497119Z","title":"Transformers are RNNs: Fast autoregres- sive transformers with linear attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.10923","last_updated":"2026-08-06T06:37:08Z","snapshot_observed_at":"2026-08-08T15:17:40.735371Z","submitted_at":"2026-07-12T21:05:55Z","title":"Infrared Organization and Critical Cognitive Field Formation in Transformer Dynamics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T08:17:20.497119Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2607.10923"},"observation_digest":"sha256:bcdd4428cf63d2f718431fcbb4de60f4e002f13db074e927dd4b326406a8fa85","observation_id":"ef665924-8d71-4229-b00b-aa9f48e8eea5","resolution":{"observed_at":"2026-07-14T08:17:20.497119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-02T07:10:13.996414Z","title":"Transformers are RNNs: Fast autoregres- sive transformers with linear attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.10923","last_updated":"2026-08-06T06:37:08Z","snapshot_observed_at":"2026-08-08T15:17:40.735371Z","submitted_at":"2026-07-12T21:05:55Z","title":"Infrared Organization and Critical Cognitive Field Formation in Transformer Dynamics","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:10:13.996414Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2607.10923"},"observation_digest":"sha256:821fcf386acbeac0b7dadd509c9607ee9abd3e1d2444207c1d5f2c0cedaaa03b","observation_id":"7146ade8-5bd8-49fc-8d4d-e7539b2db5ec","resolution":{"observed_at":"2026-08-02T07:10:13.996414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-01T15:02:08.396594Z","title":"Transformers are RNNs: Fast autoregressive transformers with linear attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18589","last_updated":"2026-07-20T23:49:42Z","snapshot_observed_at":"2026-08-07T23:07:05.199302Z","submitted_at":"2026-07-20T23:49:42Z","title":"Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:02:08.396594Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2607.18589"},"observation_digest":"sha256:6acdaf2e88b75abb3811af35f886429008bb245d877fc77d53bb21eb5e41dbe7","observation_id":"a313df4e-2275-461a-ae53-5a001b719130","resolution":{"observed_at":"2026-08-01T15:02:08.396594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-02T09:52:43.533456Z","title":"Available: https://doi.org/10.48550/arXiv.2006.16236","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.24788","last_updated":"2026-06-26T17:48:13Z","snapshot_observed_at":"2026-08-04T08:13:02.039551Z","submitted_at":"2026-06-26T17:48:13Z","title":"GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference","version":1},"reference_index":5165,"source":"pdf_text","source_observed_at":"2026-08-02T09:52:43.533456Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2607.24788"},"observation_digest":"sha256:558aa353f4ea8ed9804446b1c089d5460037e3199320302f9d9faf5cbd4d8572","observation_id":"a8bafb3e-05a2-4491-8723-5253ca427a75","resolution":{"observed_at":"2026-08-02T09:52:43.533456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.16236/citation-record","integrity":"/paper/2006.16236/integrity","json":"/paper/2006.16236/citation-record.json","paper":"/paper/2006.16236"},"outbound":[],"paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2006.16236."}