{"as_of":"2026-08-08T15:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2144d64ceeef4d9a663183aec89e897f8ba6a44410dc3affa070aee49af366e4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:25:42.751276Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.246124Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T05:20:12.134340Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2407.04620"},"observation_digest":"sha256:6b4341046ce817e4a0fa2a58994b406ac93ca0cfccad0c792339fc9676d4da0b","observation_id":"45cbfaf9-f7d9-45b4-8537-f62bbf4cdf09","resolution":{"observed_at":"2026-05-15T05:20:12.362233Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-08T12:25:42.751276Z","title":"Par- allelizing linear transformers with the delta rule over se- quence length","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.751276Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:9bdb8f930a1bd22ceddfa60fdbf708e9a40736997a172ffa6a291f1e2622abab","observation_id":"a2b0d8cd-b9c5-450a-8bba-bde9b09a046c","resolution":{"observed_at":"2026-08-08T12:25:42.751276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T22:10:15.942223Z","title":"Gated linear at- tention transformers with hardware-efficient training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09287","last_updated":"2025-02-13T13:01:46Z","snapshot_observed_at":"2026-08-07T21:59:15.838366Z","submitted_at":"2025-02-13T13:01:46Z","title":"An Uncertainty Principle for Linear Recurrent Neural Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:15.942223Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2502.09287"},"observation_digest":"sha256:72c45947ab0d41f5f36db9f4eaba49dc8111630d5a8b2303ff52fc7950625358","observation_id":"d4861c86-2a08-49fc-a7d7-aec6e08425eb","resolution":{"observed_at":"2026-08-07T22:10:15.942223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T20:21:58.415098Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09844","last_updated":"2025-05-28T00:52:33Z","snapshot_observed_at":"2026-08-07T20:15:30.842578Z","submitted_at":"2025-02-14T01:06:15Z","title":"Solving Empirical Bayes via Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:58.415098Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2502.09844"},"observation_digest":"sha256:9e56c36cc65daa06ca1181853ba1f88ec8f6f1b01c5c63a1ee7095e544f94044","observation_id":"0ec81779-3758-4fce-8c0d-3256b2e0dd59","resolution":{"observed_at":"2026-08-07T20:21:58.415098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T15:35:36.402647Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.402647Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:3dd38336a8fbb2f73b46493cdf9fa59652987a040b9a0a9dafde64f71a2b5af6","observation_id":"18f01554-4540-4ce8-be3f-b9fbe424a5b2","resolution":{"observed_at":"2026-08-07T15:35:36.402647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T14:19:54.017185Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19488","last_updated":"2025-05-26T04:15:38Z","snapshot_observed_at":"2026-08-07T21:30:44.646659Z","submitted_at":"2025-05-26T04:15:38Z","title":"Understanding Transformer from the Perspective of Associative Memory","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.017185Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.19488"},"observation_digest":"sha256:96880cd6af095c0028a4df0a8dc8a2e5d45157dad0bb79bf6633711465768b08","observation_id":"02c654cb-d479-431e-b9f7-197bf653f528","resolution":{"observed_at":"2026-08-07T14:19:54.017185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T13:53:43.404040Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20836","last_updated":"2025-05-27T07:57:35Z","snapshot_observed_at":"2026-08-07T22:06:07.558958Z","submitted_at":"2025-05-27T07:57:35Z","title":"HAD: Hybrid Architecture Distillation Outperforms Teacher in Genomic Sequence Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:43.404040Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.20836"},"observation_digest":"sha256:1c7f0e8324090f0a02b3d426546de8c44778392f4a783df10a8da25cae5df2e9","observation_id":"23b43d5e-128a-4cf9-b784-405c7b5b86e2","resolution":{"observed_at":"2026-08-07T13:53:43.404040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T13:13:28.091568Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.091568Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:25c05fd896d8fd348d782a47b270ff44dbf74287dd5583246f069723ed86f492","observation_id":"232cce74-e538-4a71-8cb9-6ad92e78a480","resolution":{"observed_at":"2026-08-07T13:13:28.091568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2505.23884","last_updated":"2025-05-29T17:50:34Z","snapshot_observed_at":"2026-08-02T10:36:55.936254Z","submitted_at":"2025-05-29T17:50:34Z","title":"Test-Time Training Done Right","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T11:25:45.153563Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.23884"},"observation_digest":"sha256:f1c0e31e9fdafba60a1e0cb7cacce23ef59ae85a2cd0213a23e242fa380c5a0c","observation_id":"62fd2402-dff1-48e8-b4f3-c9e6fdceaf46","resolution":{"observed_at":"2026-05-16T11:25:45.215790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T06:04:35.156790Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-07T05:54:59.580995Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:35.156790Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2506.06266"},"observation_digest":"sha256:1d40478b007511ee6f3d0c2e68f3516e95f2cc912f932f5f012ebf861e152e49","observation_id":"83eca67f-71cf-45bc-b181-ec21efb3df9d","resolution":{"observed_at":"2026-08-07T06:04:35.156790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T05:06:32.732274Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.732274Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:3189d5064febe9226b8129874447f0be3eff48c00e89de69285125b8eacc43b6","observation_id":"ba368b4c-83f6-4f2c-9b86-76d1891b91af","resolution":{"observed_at":"2026-08-07T05:06:32.732274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T01:09:03.309496Z","title":"Y ang, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11997","last_updated":"2025-06-13T17:51:37Z","snapshot_observed_at":"2026-08-07T00:56:52.034236Z","submitted_at":"2025-06-13T17:51:37Z","title":"pLSTM: parallelizable Linear Source Transition Mark networks","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T01:09:03.309496Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2506.11997"},"observation_digest":"sha256:2b128f0e4378fe8c720c182a438c7b04df591a5da5c3b7b03b2ab567407c311d","observation_id":"97f09e7b-fda8-42f7-ab1c-af5db940abdd","resolution":{"observed_at":"2026-08-07T01:09:03.309496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-06T23:34:48.547568Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.547568Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:9d732fbf0eabfa02dde4a8d99cf9a47f9e1b4d411161054a84e814a623bae31c","observation_id":"1e1eccb2-dc13-48c8-b255-08e6364afbe2","resolution":{"observed_at":"2026-08-06T23:34:48.547568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-06T19:14:32.936567Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-07T04:57:37.201438Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:32.936567Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2507.06203"},"observation_digest":"sha256:08cd40ec4efdeb6e402906b1ee74a41228e771fdabfe4c4eefed39e26f066f82","observation_id":"e8f220fa-a809-4837-a241-12a35269490b","resolution":{"observed_at":"2026-08-06T19:14:32.936567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-05T05:29:21.681430Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-08T13:14:59.554723Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.681430Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:7982c383584f2fa0bffaa74601bb34be6901d8bd316f384dceec1cf345f9d8be","observation_id":"f7501579-84d1-44ef-9bf6-57230956cc11","resolution":{"observed_at":"2026-08-05T05:29:21.681430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-04T08:12:26.022787Z","title":"Parallelizing linear transformers with the delta rule over sequence length,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22052","last_updated":"2026-07-09T14:33:48Z","snapshot_observed_at":"2026-08-08T12:44:25.816252Z","submitted_at":"2025-10-24T22:21:08Z","title":"A Vision Toward Energy-Efficient Domain-Specific Artificial Intelligence Models and Agents","version":2},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:26.022787Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2510.22052"},"observation_digest":"sha256:7691743af5a29b8c65dc0224329d802df911a717cd63f6a1fcbd7ce85c46b049","observation_id":"7356987f-d11c-4a9d-b54c-fcb96e8ae67a","resolution":{"observed_at":"2026-08-04T08:12:26.022787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2510.26083","last_updated":"2026-04-08T13:55:00Z","snapshot_observed_at":"2026-07-06T22:34:28.484520Z","submitted_at":"2025-10-30T02:41:54Z","title":"Nirvana: A Specialized Generalist Model With Task-Aware Memory Mechanism","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T03:05:06.069642Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2510.26083"},"observation_digest":"sha256:097cef37ca4e313a140c4b3a951856b31af0a9f942d8ed6f0b3aad094a0dc90f","observation_id":"2c7c4f8b-9510-468a-90ef-3938ee3967c0","resolution":{"observed_at":"2026-05-18T03:05:48.075690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:46d5fd8acd3555c2ed23ba64137f562b462677a970a79dbf52d895d4669399d3","observation_id":"2ff72c95-29fb-42f6-bd33-9d57a928ab5a","resolution":{"observed_at":"2026-05-13T23:49:10.947759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-04T06:42:11.959356Z","title":"Parallelizing linear transformers with the delta rule over sequence length,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15038","last_updated":"2026-08-02T11:54:24Z","snapshot_observed_at":"2026-08-08T01:30:53.141852Z","submitted_at":"2025-12-17T03:03:40Z","title":"LADY: Linear Attention for Autonomous Driving Efficiency without Transformers","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T06:42:11.959356Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2512.15038"},"observation_digest":"sha256:17a9e502535ab98f3b63912e48abc8101021b7304c0bb7fa38bc3aededdc1254","observation_id":"89921422-127d-466e-a755-21bce9b43d24","resolution":{"observed_at":"2026-08-04T06:42:11.959356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-03T15:22:55.477441Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:55.477441Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:5e039141d6dea6891507a8df8abb3b59f70cff36a30392c9eeb7f52b33d616be","observation_id":"d9ea9905-e22c-49f2-91f1-fd79b33813c1","resolution":{"observed_at":"2026-08-03T15:22:55.477441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2603.04385","last_updated":"2026-04-08T22:29:40Z","snapshot_observed_at":"2026-07-06T22:47:50.848191Z","submitted_at":"2026-03-04T18:49:37Z","title":"ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T16:21:16.229770Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2603.04385"},"observation_digest":"sha256:96affc1412ce5906bf4e66220adb945bdba9fc1f696df6b6e5aecebe8008ff1a","observation_id":"0d74fb44-14e2-4840-82e4-fa5e16a48c4a","resolution":{"observed_at":"2026-05-15T16:26:17.502452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2604.05030","last_updated":"2026-04-28T16:30:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T18:00:03Z","title":"Phase-Associative Memory: Sequence Modeling in Complex Hilbert Space","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T19:39:50.311059Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2604.05030"},"observation_digest":"sha256:f7463889e53e615a9cd00f0da81e18bd8ab4fd1287243fc4963d5ee8b1b217a1","observation_id":"6056f5d8-f335-4de9-8225-71322553850c","resolution":{"observed_at":"2026-05-10T22:40:48.610341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2604.06169","last_updated":"2026-04-07T17:59:44Z","snapshot_observed_at":"2026-08-03T02:43:13.230039Z","submitted_at":"2026-04-07T17:59:44Z","title":"In-Place Test-Time Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:47.174513Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2604.06169"},"observation_digest":"sha256:26138eca991575c7e03924539922b9d1448d1f8981afefb6ed9335eb738865ef","observation_id":"5767fc1c-ee17-4eb9-94b1-5624f8e8337b","resolution":{"observed_at":"2026-05-10T23:30:49.017551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2604.10597","last_updated":"2026-05-02T01:07:43Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T12:07:48Z","title":"COREY: Entropy-Guided Runtime Chunk Scheduling for Selective Scan Kernels","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:10:02.445509Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2604.10597"},"observation_digest":"sha256:68a58fdc3e5d34ccede011be2ac51a7ab86f529060eedd25cdbc6bf281ad0b35","observation_id":"cefb2429-bd4c-4845-84e1-d1a29bca075d","resolution":{"observed_at":"2026-05-11T11:06:03.419188Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2605.06946","last_updated":"2026-05-07T21:05:28Z","snapshot_observed_at":"2026-08-04T02:08:48.810630Z","submitted_at":"2026-05-07T21:05:28Z","title":"Adaptive Memory Decay for Log-Linear Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-11T01:02:56.848785Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2605.06946"},"observation_digest":"sha256:fe762535e771c52c8716317ecdd474dc7854e2d899324ecf27eee564c6cc9315","observation_id":"13e9f8fe-4a18-4c48-a4d5-589d3698fa85","resolution":{"observed_at":"2026-05-11T04:50:56.408116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-14T20:53:40.666929Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:ce503ab8e59f20621ecaf8dfa69e0a4ad48791c0856ed28939ac0489573acb03","observation_id":"92437f3f-a79a-45a7-b2b5-9048abe9d5a1","resolution":{"observed_at":"2026-05-14T20:59:28.639301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-15T04:59:11.877068Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:8b6a253f5af49fb0ef47b770d8903042aedd7d57038c6cbf551d3d36ed2907e9","observation_id":"5f2fda31-0cc1-4eb1-b180-e08fd22bd39b","resolution":{"observed_at":"2026-05-15T04:59:45.229904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2605.21070","last_updated":"2026-05-20T11:56:15Z","snapshot_observed_at":"2026-07-06T23:31:32.577242Z","submitted_at":"2026-05-20T11:56:15Z","title":"Towards Understanding Self-Pretraining for Sequence Classification","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-21T05:29:58.809024Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2605.21070"},"observation_digest":"sha256:8e49235e58337b26e99372c0e00f3171eb44915a74cd1124614c6df83ab8af7b","observation_id":"acf0bbbd-8876-4b89-8c2b-64d76c440ad0","resolution":{"observed_at":"2026-05-21T05:33:58.947730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2606.06479","last_updated":"2026-07-24T17:49:34Z","snapshot_observed_at":"2026-08-02T12:20:41.406405Z","submitted_at":"2026-06-04T17:57:33Z","title":"Pretraining Recurrent Networks without Recurrence","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-06-28T02:09:01.018909Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2606.06479"},"observation_digest":"sha256:e0abb0f2ff27eb8d332ad7a4a40c09c8cbfcaec6a716a1b0743dda8833be6535","observation_id":"6b38ad3b-883b-47a6-9e75-d3ab1ffdac2c","resolution":{"observed_at":"2026-07-02T12:26:56.635118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-02T12:20:56.082616Z","title":"Parallelizing linear transformers with the delta rule over sequence length, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06479","last_updated":"2026-07-24T17:49:34Z","snapshot_observed_at":"2026-08-02T12:20:41.406405Z","submitted_at":"2026-06-04T17:57:33Z","title":"Pretraining Recurrent Networks without Recurrence","version":2},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-02T12:20:56.082616Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2606.06479"},"observation_digest":"sha256:3cdcddc439ac24adc855b5b7825c6cb1c9487523f728a796947779736b37ca30","observation_id":"0bc8bce5-eb20-43ed-907b-64dc34790fea","resolution":{"observed_at":"2026-08-02T12:20:56.082616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2606.07404","last_updated":"2026-06-05T15:48:42Z","snapshot_observed_at":"2026-07-06T23:47:05.104295Z","submitted_at":"2026-06-05T15:48:42Z","title":"Reversible Foundations: Training a 120B Sparse MoE through State-Preserving Scaling","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T22:55:09.477413Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2606.07404"},"observation_digest":"sha256:0d05ff01bf0ed21ccd84e1887915b5eb47e65b2fcd44c5835386343cb1e3b407","observation_id":"ae2b1780-dc47-47ba-b973-84e95c2a6006","resolution":{"observed_at":"2026-07-02T16:17:08.659060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2606.08804","last_updated":"2026-06-07T19:49:01Z","snapshot_observed_at":"2026-08-04T14:57:16.793688Z","submitted_at":"2026-06-07T19:49:01Z","title":"Q-Delta: Beyond Key-Value Associative State Evolution","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-27T18:30:51.523567Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2606.08804"},"observation_digest":"sha256:5f854cadd159441036eeef48456661cea0792cf8a769616e7bd172d81a46c053","observation_id":"b240309e-de36-4b54-a789-cbaff4debd74","resolution":{"observed_at":"2026-07-02T23:07:26.542463Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2606.20474","last_updated":"2026-06-19T08:02:54Z","snapshot_observed_at":"2026-08-07T06:14:47.064796Z","submitted_at":"2026-06-18T16:54:07Z","title":"UltraQuant: 4-bit KV Caching for Context-Heavy Agents","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T17:49:02.835708Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2606.20474"},"observation_digest":"sha256:83532811ff4fdacc0ffb449a656b3bc4e11721da735671bcc0f4ca25aa76a670","observation_id":"19a33f76-fce7-4f0f-a010-4f98ee69db51","resolution":{"observed_at":"2026-07-04T03:39:30.395444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-12T00:55:09.690245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03652","last_updated":"2026-07-04T00:52:06Z","snapshot_observed_at":"2026-08-07T04:49:22.708900Z","submitted_at":"2026-07-04T00:52:06Z","title":"ELiTeFormer: An Efficient Transformer for FPGAs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T00:55:09.690245Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2607.03652"},"observation_digest":"sha256:3b86fa49d695d32bafd6bb83491de63d5be5a702ec956f5804e933496469632d","observation_id":"9ca11e76-f7f5-48d7-b5e9-c377b9e88a02","resolution":{"observed_at":"2026-07-12T00:55:09.690245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2607.07386","last_updated":"2026-07-08T13:17:19Z","snapshot_observed_at":"2026-08-06T16:46:55.298935Z","submitted_at":"2026-07-08T13:17:19Z","title":"Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-07-09T12:40:09.036905Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2607.07386"},"observation_digest":"sha256:beecbfd697ab9fc863056aa46463bb49d442300f4a93c0fb865885998904db85","observation_id":"43c01be1-5d43-46ce-bc59-8222c393ed08","resolution":{"observed_at":"2026-07-09T12:46:14.646570Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":"2406.06484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-07-10T01:36:44.246124Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":"cs.LG","work_id":"2eace419-f59b-4ee9-9c02-ea3a9fde82c0","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:74d59e5eb462bf3df926648b1d1c9403a7992fdf477ed892dfd63c6a6c529e79","observation_id":"4301c229-8a9b-405e-b51f-8591ae6b2b84","resolution":{"observed_at":"2026-07-10T01:36:44.247325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-02T09:06:11.171935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19390","last_updated":"2026-07-23T12:47:31Z","snapshot_observed_at":"2026-08-06T04:48:50.455284Z","submitted_at":"2026-07-02T18:54:23Z","title":"The Orthogonalized Read Is a Removable Training Scaffold for Recurrent Memory","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T09:06:11.171935Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2607.19390"},"observation_digest":"sha256:a4d10948afd3951b7879fafcdf6707921bd50f90e0654966f53c01cf78ac44b7","observation_id":"9568a843-40ac-4db2-9004-f5155f3a2d5b","resolution":{"observed_at":"2026-08-02T09:06:11.171935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-04T13:43:51.979801Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-08T15:11:03.262995Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T13:43:51.979801Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:8d9a7347b069b09d3641fe51597865959396ff8993e08209d2cddf2e0af7f556","observation_id":"dfb0e7d7-7f23-40be-a02f-8603824b40bc","resolution":{"observed_at":"2026-08-04T13:43:51.979801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T00:11:48.805634Z","title":"arXiv preprint arXiv:2406.06484 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-08T15:11:03.262995Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:11:48.805634Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:719540407990c0e42c6d76dbab39a35108fe59c756c88d21605af7e0b605dafe","observation_id":"47293eaf-457b-4b0a-be73-ed5dfe5943e0","resolution":{"observed_at":"2026-08-07T00:11:48.805634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.06484/citation-record","integrity":"/paper/2406.06484/integrity","json":"/paper/2406.06484/citation-record.json","paper":"/paper/2406.06484"},"outbound":[],"paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2406.06484."}