{"as_of":"2026-08-21T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7aca459a02d969ca04e0cbfd392e277d1bf7da5accdff17c004774197f4e6b77","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:29:21.743728Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.05282/citation-record","integrity":"/paper/2509.05282/integrity","json":"/paper/2509.05282/citation-record.json","paper":"/paper/2509.05282"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-08-16T14:14:23.399336Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-05T05:29:21.224772Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.224772Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:b759fd32f6255c69a9856162c49a3a897842ecd4ce3842cf3a43686171a01d84","observation_id":"89891472-2fa5-44e8-925f-cfb8caae3765","resolution":{"observed_at":"2026-08-05T05:29:21.224772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04517","last_updated":"2024-12-06T15:42:07Z","snapshot_observed_at":"2026-08-16T13:54:34.627474Z","submitted_at":"2024-05-07T17:50:21Z","title":"xLSTM: Extended Long Short-Term Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04517","snapshot_observed_at":"2026-08-05T05:29:21.233274Z","title":"xlstm: Extended long short-term memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.233274Z"},"links":{"cited_paper":"/paper/2405.04517","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:e33f2910453ec9516e3db60a3f32a3d79671e52b1226efa985caf42bb5177afe","observation_id":"fbda726b-c63e-4033-88d7-3414895c8eab","resolution":{"observed_at":"2026-08-05T05:29:21.233274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.672770Z","title":"Rethinking attention with performers","venue":null,"work_id":"6ae90a32-1e43-482e-a6d5-1dd39d96593f","year":2021},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.243441Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:547d1cf2d159cc9bab69ea3ef76debacae9c712bf414cd591f14406aa511161f","observation_id":"1888d2b2-25dd-42c7-9a41-56c1d7a27c0a","resolution":{"observed_at":"2026-08-05T05:29:23.682155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.645538Z","title":"Meta LA : Unified optimal linear approximation to softmax attention map","venue":null,"work_id":"c41d2d50-b226-4ddb-835d-c866d0e9ad7e","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.254446Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:fdcf7be2cbba91eea3009ae9de369d480bd8929c1987607a25187289594f6a1e","observation_id":"8ce69a5d-0c37-4b7c-844e-dd545dae5051","resolution":{"observed_at":"2026-08-05T05:29:23.653888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-20T00:41:09.240026Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-05T05:29:21.262663Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.262663Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:886fb154969e74ffc768014749b5bd308aeaf40b9a8e6c4724161800bae375f1","observation_id":"17ddef9c-8d2e-4d37-bb13-6aaa2b259756","resolution":{"observed_at":"2026-08-05T05:29:21.262663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-05T05:29:21.275152Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.275152Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:24fb28d11a68aa7b0734e6360dcd3a16d1398cd4b8dbde6690ee630e3f56248f","observation_id":"7c1be774-8f71-4647-8970-188d947ecf66","resolution":{"observed_at":"2026-08-05T05:29:21.275152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-08-20T11:13:49.127921Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T05:29:21.297289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.297289Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:bda53e18ee8b3fe039380d38ec768af8ea4c9cef1442b62c4910760d49154584","observation_id":"9f1ea1b3-5a5c-4b25-ba5a-f1778b03a762","resolution":{"observed_at":"2026-08-05T05:29:21.297289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.609927Z","title":"A framework for few-shot language model evaluation","venue":null,"work_id":"3996c265-c631-47a7-a616-24e046d3987e","year":2021},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.303408Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:f4ff3ba5052316623706c5a8ce3846898649e2c581b497dd98ef29001a5e4822","observation_id":"80a6e3bf-7154-4573-8aa2-2a7e5c7a6158","resolution":{"observed_at":"2026-08-05T05:29:23.624817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.313670Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.313670Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:532a83b2287e99ccb1629458c64f25a52b9686b5cbbbae5477fb7746b8e8311b","observation_id":"9020ca47-65f3-44c3-ae7b-b1ce26fa2f3c","resolution":{"observed_at":"2026-08-05T05:29:21.313670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07669","last_updated":"2020-10-23T02:48:03Z","snapshot_observed_at":"2026-08-19T19:32:24.044735Z","submitted_at":"2020-08-17T23:39:33Z","title":"HiPPO: Recurrent Memory with Optimal Polynomial Projections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07669","snapshot_observed_at":"2026-08-05T05:29:21.322644Z","title":"Hippo: Recurrent memory with optimal polynomial projections","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.322644Z"},"links":{"cited_paper":"/paper/2008.07669","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:829686605c0c293012f0ee1ba3b1a9f07d9b1fed61a2a64d244901250212faa3","observation_id":"74f7fc5d-25a4-4afc-ac7f-e7c6cb9a87b6","resolution":{"observed_at":"2026-08-05T05:29:21.322644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.548094Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"51ca6771-6e58-480d-a0c3-7ba394939cfc","year":2022},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.332376Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:dd750bed366a2ab7a331f8189dfac5ea9f211becb16d44494654cd15e1fd9521","observation_id":"988da5e4-92ea-4f2d-b320-f4bb1aabb9e4","resolution":{"observed_at":"2026-08-05T05:29:23.557610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.501114Z","title":"Efficiently modeling long sequences with structured state spaces, 2022 b","venue":null,"work_id":"5552bba7-b069-4b28-9107-894b191b0af0","year":2022},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.342717Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:36b8a51ba50fa5f65e054219f4c00c5bcdcb15e7c65a81b06ee588ee8d8b09df","observation_id":"aebe2cb9-f75f-4ff2-8016-d4a6f81fdccb","resolution":{"observed_at":"2026-08-05T05:29:23.515776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.454000Z","title":"How to train your HIPPO : State space models with generalized orthogonal basis projections","venue":null,"work_id":"a1d0d097-c787-44e9-826d-529dbe5abc78","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.351677Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:da9c95df93e733797c343fbff027f7ce876dcb018900ef38728d31f8514a5fe5","observation_id":"e75809a8-0695-4c3d-97ef-236cdbde74f2","resolution":{"observed_at":"2026-08-05T05:29:23.468672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.408842Z","title":"Diagonal state spaces are as effective as structured state spaces","venue":null,"work_id":"4fa8a39b-affa-4824-91f4-bef9a7bcc44c","year":2022},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.364827Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:495c1e96684b2f043e2e82f89ba59a06676d35faea3386ff576d96a96f287669","observation_id":"614405b5-0b03-47cb-8a96-d4f6a41b038f","resolution":{"observed_at":"2026-08-05T05:29:23.423256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.374188Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.374188Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:55dde31a9c6d3e477a46bf4b22fad93183e98ea771a321315c7d68b3eb58e3e5","observation_id":"d79615ab-2c7b-49de-9c6f-1786d8f0d647","resolution":{"observed_at":"2026-08-05T05:29:21.374188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.327680Z","title":"Mini CPM : Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":"5855090b-f827-42d2-a64a-435e28872d3b","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.382789Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:5af242ba2721a86e39c6495792e66fb225f3477d5619d6e09ebee9efc378f612","observation_id":"b16c091b-9dc2-4798-acfc-3f85bb3a0a79","resolution":{"observed_at":"2026-08-05T05:29:23.337148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.290671Z","title":"karpathy/char-rnn","venue":null,"work_id":"0d8557b4-c762-4f4e-a77f-01cc47c47fd6","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.396781Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:74fd66bf1c2e467a8869bda883068e91ed3c1134719d2e2ac07ec9f69fb9d5b6","observation_id":"8187a2b6-1e3d-4f66-ba68-3761845ed41a","resolution":{"observed_at":"2026-08-05T05:29:23.302567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.404835Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.404835Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:4380b442b3c11dfd0d28fafd2aad6cacd0546504b91e98c17caa51947a8ab466","observation_id":"8c6d6b96-a4d1-4091-b702-27f6a0212af8","resolution":{"observed_at":"2026-08-05T05:29:21.404835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.414483Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.414483Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:95f9040fb05b9a0da7a169dd35c8f9a6df3c34d9d451d142692ef0d71d2c4c9a","observation_id":"f04b8b1f-c3bf-478c-a523-8c43b076e9f1","resolution":{"observed_at":"2026-08-05T05:29:21.414483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10655","last_updated":"2023-01-28T06:33:20Z","snapshot_observed_at":"2026-08-19T21:26:40.470713Z","submitted_at":"2022-09-21T20:52:17Z","title":"Mega: Moving Average Equipped Gated Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10655","snapshot_observed_at":"2026-08-05T05:29:21.423018Z","title":"Mega: Moving average equipped gated attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.423018Z"},"links":{"cited_paper":"/paper/2209.10655","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:6a165dac6c1455496d43463c2000c06cb221ecb9423dfa80dd5120842d9ca387","observation_id":"cb6d689f-c2b5-4df3-acf8-86b65904c0a7","resolution":{"observed_at":"2026-08-05T05:29:21.423018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.191027Z","title":"Megalodon: Efficient LLM pretraining and inference with unlimited context length","venue":null,"work_id":"fbe9e544-aee2-4f3e-8e5a-5db182836f13","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.431883Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:10cfc79643ac11ea0789ccf3b5a000287b4e2e0229a580a77f4144e2397d0be5","observation_id":"de140dd9-4a9e-4514-b005-d20e03d6f1b1","resolution":{"observed_at":"2026-08-05T05:29:23.204463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.144363Z","title":"Parallelizing linear recurrent neural nets over sequence length","venue":null,"work_id":"ddd37200-e710-4962-b2f2-8905f050efd8","year":2018},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.445638Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:50a20e939621f2c8c79e48d11d4eb7c6ec7a741082ebf21f24ba2e10f43420b3","observation_id":"566b7909-647f-4d16-abbe-2aec11a9c699","resolution":{"observed_at":"2026-08-05T05:29:23.154218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.108591Z","title":"Smith, Albert Gu, Anushan Fernando, C aglar G \\\" u l c ehre, Razvan Pascanu, and Soham De","venue":null,"work_id":"05ac2dea-b32e-4267-a819-72488bd6789d","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.455590Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:d5e03e3d916ad1126d945a9be26b961b222232e68c7527f2e724fb96ecdd937a","observation_id":"930a7225-662a-4293-9ada-69a310248546","resolution":{"observed_at":"2026-08-05T05:29:23.119574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.464459Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.464459Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:301f92c89a96c8e788070d337df8ac2c15227d718a2cd80509c4ed89e5a34d94","observation_id":"fc08e730-ffc7-4d7d-a912-79fe79728fa0","resolution":{"observed_at":"2026-08-05T05:29:21.464459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.476039Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.476039Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:1179b643302d0ff79e17276ccaf77173f484037972154b62baa23f0dbc118195","observation_id":"77868b3b-607e-439a-9ee0-22f16d1c99ce","resolution":{"observed_at":"2026-08-05T05:29:21.476039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-05T05:29:21.484059Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.484059Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:73adae298fa62015c50cf32c1debe4d435f6d02761cba8ee421fdccdb0ab2552","observation_id":"7607eb1f-61b0-4137-92c7-92124f863628","resolution":{"observed_at":"2026-08-05T05:29:21.484059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:23.026698Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":"623292c7-d767-4bdf-bf10-e2b0da4609d9","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.494686Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:e587b0601f99837d24dbdcb19cddab0f6e716d0758295fffa1a1472bab27a891","observation_id":"a12fa02a-2101-42b0-ac6b-dbc1471709cc","resolution":{"observed_at":"2026-08-05T05:29:23.035501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.990000Z","title":"Eagle and finch: RWKV with matrix-valued states and dynamic recurrence","venue":null,"work_id":"24138b28-7c60-4332-82f9-f620dfdbb712","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.501983Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:8aa6d8f6e73d2da79ed0b2742e385ded756629ec56dc9ff27bb26cfc02e55906","observation_id":"14ef27a6-2ae2-48c8-b59c-aee978d5354d","resolution":{"observed_at":"2026-08-05T05:29:23.003112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.958733Z","title":"Wind, Tianyi Wu, Daniel Wuttke, and Christian Zhou-Zheng","venue":null,"work_id":"0a1ea77f-c421-483c-ad41-4eb45c440b95","year":2025},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.509250Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:b27071ea7c0d2e44a9956c76cf26b4a8df83d13936e29e0716ed624fcded2131","observation_id":"c23e5586-a6fe-487a-b574-1b9abe48f768","resolution":{"observed_at":"2026-08-05T05:29:22.965494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.02143","last_updated":"2021-03-19T21:24:06Z","snapshot_observed_at":"2026-08-16T18:41:40.971095Z","submitted_at":"2021-03-03T02:48:56Z","title":"Random Feature Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.02143","snapshot_observed_at":"2026-08-05T05:29:21.517415Z","title":"Random feature attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.517415Z"},"links":{"cited_paper":"/paper/2103.02143","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:c99baed903ce3b4434a756c195ff502d8eb33cdea71585c4e14fdcb6f302ebea","observation_id":"d30f7494-0234-4161-bc89-1c7483ff83a8","resolution":{"observed_at":"2026-08-05T05:29:21.517415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.921739Z","title":"Xmixers: A collection of SOTA efficient token/channel mixers , August 2025","venue":null,"work_id":"90c3987f-9d61-4c00-affc-f0f85ae8f738","year":2025},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.524533Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:e655a62ca962ea5cc9f3c0904b4f95721e134d73ce4c71bcc1cec3ba53396374","observation_id":"6c3e7b33-5b10-418b-875d-4269f04d841d","resolution":{"observed_at":"2026-08-05T05:29:22.930865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.891172Z","title":"cosformer: Rethinking softmax in attention","venue":null,"work_id":"e0f9d914-215a-4dfb-9094-67f9aa4a1148","year":2021},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.534377Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:1888cfbad26e34da17f32aba96fe2d9bfcda883a59b3759fc21e40b2c5d13864","observation_id":"022da19e-acc2-4ee4-90bf-3db455997ed2","resolution":{"observed_at":"2026-08-05T05:29:22.899641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10340","last_updated":"2022-10-19T07:15:35Z","snapshot_observed_at":"2026-08-16T16:22:58.046387Z","submitted_at":"2022-10-19T07:15:35Z","title":"The Devil in Linear Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10340","snapshot_observed_at":"2026-08-05T05:29:21.542261Z","title":"The devil in linear transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.542261Z"},"links":{"cited_paper":"/paper/2210.10340","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:ea22ae770f81731044654cacc589d3ceaff357872fc40e2bce7ac67d12d46441","observation_id":"738a3e85-9a00-49fb-8f02-f0917bfbfa8c","resolution":{"observed_at":"2026-08-05T05:29:21.542261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.863883Z","title":"Toeplitz neural network for sequence modeling","venue":null,"work_id":"dfbea491-26be-4c0f-b527-e649912dc335","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.550625Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:0652b913bf73ddcc54079c3d10d7b17fbb563f8c06f1876970eaeb7f9ae7c7b7","observation_id":"4b9922c6-d23c-4202-9c2f-d91ca05800c4","resolution":{"observed_at":"2026-08-05T05:29:22.873495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14995","last_updated":"2024-01-19T07:47:01Z","snapshot_observed_at":"2026-08-16T15:12:45.594763Z","submitted_at":"2023-07-27T16:45:33Z","title":"TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14995","snapshot_observed_at":"2026-08-05T05:29:21.559505Z","title":"Scaling transnormer to 175 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.559505Z"},"links":{"cited_paper":"/paper/2307.14995","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:a5e2d1ca2709ac06242656427f3e6e49d5e711bc04e24f8974659d903678c543","observation_id":"219a30f7-8592-4f92-b4d1-3df23f1fa5c5","resolution":{"observed_at":"2026-08-05T05:29:21.559505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.835836Z","title":"Linearized relative positional encoding","venue":null,"work_id":"5b819957-e22f-468b-a6e2-f5230258a18e","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.566680Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:2013634ba2e3590465f560adc0f7442ab6895e841bfc5dee279072044c20d346","observation_id":"e4ee173c-c79a-4d79-a588-5b52118d3caf","resolution":{"observed_at":"2026-08-05T05:29:22.845668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.810145Z","title":"Hierarchically gated recurrent neural network for sequence modeling","venue":null,"work_id":"baee8097-242c-41d9-97ee-df1e5bf459ad","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.577633Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:e3a78ff49be21c0112ef00def74e8873693b322e47b657677caa8da17d5ff135","observation_id":"e84a4b9e-4176-4522-95a7-62231c39f861","resolution":{"observed_at":"2026-08-05T05:29:22.817349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.786892Z","title":"Various lengths, constant speed: Efficient language modeling with lightning attention","venue":null,"work_id":"10ffdc3b-7c6b-4336-a549-afe6fc53b980","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.587811Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:dad573c2b1293dc0cfd565b53f845f2756f1d24744fc6fb93c7807b17e8c9425","observation_id":"0329688e-c5a2-44b2-b96b-2e11ce5b4554","resolution":{"observed_at":"2026-08-05T05:29:22.794782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07904","last_updated":"2024-08-19T17:16:55Z","snapshot_observed_at":"2026-08-16T14:01:40.481918Z","submitted_at":"2024-04-11T16:43:03Z","title":"HGRN2: Gated Linear RNNs with State Expansion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07904","snapshot_observed_at":"2026-08-05T05:29:21.596988Z","title":"Hgrn2: Gated linear rnns with state expansion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.596988Z"},"links":{"cited_paper":"/paper/2404.07904","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:63bd10d45ada39b31d25929dd0e44cb543b67b35253d4f93c0d9a7453e7f2a95","observation_id":"6f9b6f7c-42b2-4d19-9f4f-fb6d6cc589ad","resolution":{"observed_at":"2026-08-05T05:29:21.596988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.751409Z","title":"You only scan once: Efficient multi-dimension sequential modeling with lightnet, 2025","venue":null,"work_id":"d9bcbbb9-5ac7-40dd-a25a-a01eada03997","year":2025},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.604233Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:09793c465032546a6bb9ce2b43714605387b6c5348f97914eefdc5752159d53b","observation_id":"e804ff4f-46ef-4139-a63c-bac7c7ce7706","resolution":{"observed_at":"2026-08-05T05:29:22.759829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.611583Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.611583Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:15a426e4c9da3a9c92c9585670b98ebba71e1c4bffacab333c0ba5f4ae2d5d0d","observation_id":"a2dbcf6b-1cdb-4182-9f18-767eaec8b51c","resolution":{"observed_at":"2026-08-05T05:29:21.611583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T05:29:21.618028Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.618028Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:9d18f6cea9811531c2d00ba6db9cb05929c75bdd845cf533f8d6e83136ed7919","observation_id":"1f2ecb66-ebfa-4a9c-bd07-5605fdbd84b8","resolution":{"observed_at":"2026-08-05T05:29:21.618028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.671246Z","title":null,"venue":null,"work_id":"aad2fdf8-048d-4b08-9a64-55e347c11ade","year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.625962Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:a2a19a108586388dc23cbb409c17f9509564ebdee903c6b25326f2765465d65f","observation_id":"5394bf43-a95c-4bd5-929a-703e3924c8d9","resolution":{"observed_at":"2026-08-05T05:29:22.686591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T05:29:21.632471Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.632471Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:92f9e44ef189caa90089c245a12bdee9d2ce922f60bf3d1ace5c1befb0acc942","observation_id":"456e7573-6640-40f8-bd9f-33ffc5717c4f","resolution":{"observed_at":"2026-08-05T05:29:21.632471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T05:29:21.643312Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.643312Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:77019e594dc744e52c333e9b5085b5beb3e367037d8f6f22da635d6317824ce6","observation_id":"82f30b11-7f94-472e-98e5-4af85159a181","resolution":{"observed_at":"2026-08-05T05:29:21.643312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.621900Z","title":"FLA: A Triton-Based Library for Hardware-Efficient Implementations of Linear Attention Mechanism , January 2024 a","venue":null,"work_id":"b3c499e9-0010-4b64-9e51-a486d5e4f13f","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.651113Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:4f46db8c295de7ad95b7497c457eaf4a513b8cff3d0f6e4dfa55fe040c32b1b0","observation_id":"7d7e2a31-61a6-4048-9406-737e9c525542","resolution":{"observed_at":"2026-08-05T05:29:22.632745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.575772Z","title":"Fla: A triton-based library for hardware-efficient implementations of linear attention mechanism, January 2024 b","venue":null,"work_id":"b87710d9-c96e-4671-9885-6f672136daf4","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.660488Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:57bd5884fce171351c82348d516478aaca8c53aa1727f9b40d668caea329db26","observation_id":"979a21b1-cea9-4d2f-9bf6-17c4c5eef8b6","resolution":{"observed_at":"2026-08-05T05:29:22.591469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-21T01:26:32.098232Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-05T05:29:21.669673Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.669673Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:6292dee1bd8906e5c596d8f2200ec935fdd348248750a945eb0b9f647d2618da","observation_id":"7c743cdd-2dde-4285-98aa-6a60e0fa94c8","resolution":{"observed_at":"2026-08-05T05:29:21.669673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-16T13:44:27.642787Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-05T05:29:21.681430Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.681430Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:9aa71ee7c072f1a1162f16718ddfcbb466b1a7a0bed3e595b7c119725b7f7426","observation_id":"f7501579-84d1-44ef-9bf6-57230956cc11","resolution":{"observed_at":"2026-08-05T05:29:21.681430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.541186Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":"68e92b8b-a704-44da-9349-596b000ab3b5","year":2025},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.692890Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:b3ec951f9702146e83657647175694ad4a9f74086a6abec7fe4ba06805a21ed1","observation_id":"c0841f48-777f-4680-9a3c-be66d67c5b23","resolution":{"observed_at":"2026-08-05T05:29:22.554528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.512048Z","title":"Gated slot attention for efficient linear-time sequence modeling","venue":null,"work_id":"9a71ff6c-02b3-43f3-88f4-2ad740668694","year":2024},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.699941Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:c07f9d647bc60250c4b8b6b42703d6e7e533d0af07f696a2e562d81e90a34798","observation_id":"dd4e6f17-820c-44a4-b750-6feee686e548","resolution":{"observed_at":"2026-08-05T05:29:22.522156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:22.478699Z","title":"fla-org/flame","venue":null,"work_id":"9fa62515-a6a5-4ca7-9108-16c00ee27271","year":2025},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.708336Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:d334aa939ffc95a29d2f9934fc230e2aa6c2a5690288cb1436f636245cdd0189","observation_id":"0eaa0d4b-b43b-4c5c-b55d-0db9b5c73978","resolution":{"observed_at":"2026-08-05T05:29:22.491124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.716228Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.716228Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:28f7af6d456201b1db274f09ba520a8a75fe6a30a206d47c9c6ffde66eeda691","observation_id":"b3281d0e-2cc7-4aa6-87e4-6edd7db4945d","resolution":{"observed_at":"2026-08-05T05:29:21.716228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.727367Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.727367Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:8c279cc27bba4bdcab68bd6ce85ec943397d5030f9bd4ad3da2a9cb1745f823f","observation_id":"f3565951-46e0-4f4b-899e-37a0efc29770","resolution":{"observed_at":"2026-08-05T05:29:21.727367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.733982Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.733982Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:a679a1723e8d2a1f3e25d57d05b1bf1b78f99a1943d9358f5d2f62d7abe8b4de","observation_id":"5b3815e7-97f5-4079-8a1a-b83e74deaedc","resolution":{"observed_at":"2026-08-05T05:29:21.733982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:29:21.743728Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:21.743728Z"},"links":{"citing_paper":"/paper/2509.05282"},"observation_digest":"sha256:9e0fe5e8a8f533a62f3534729fc8f2d73fec0c8f419f22778efe6dcdcbf33508","observation_id":"c0142dc5-23c5-4939-bf68-486fa4c91203","resolution":{"observed_at":"2026-08-05T05:29:21.743728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.05282","last_updated":"2025-09-05T17:48:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T19:02:15.615097Z","submitted_at":"2025-09-05T17:48:26Z","title":"Elucidating the Design Space of Decay in Linear Attention"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2509.05282."}