{"as_of":"2026-08-06T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c983bfde58a8c308b0c07553b2a1ffb2caf05875a7795b995c552e415b25b350","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T19:08:18.768344Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.13473/citation-record","integrity":"/paper/2605.13473/integrity","json":"/paper/2605.13473/citation-record.json","paper":"/paper/2605.13473"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":"79950075-a669-4e48-8bc9-28cc29e8d753","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:59a6ea0875b10165a7f69a39ffdf4d60c925f41170c680e26b7e3f179a27562c","observation_id":"4f01d78d-e5c3-429a-bae9-5f55efbd6c15","resolution":{"observed_at":"2026-05-14T19:09:23.991827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-05T07:11:50.808005Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2312.04927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-07-03T13:48:20.285344Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"a51e0ddf-22e2-4d3c-9759-7201f7d9a699","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:4540ab3770f52b57f50dcf0d906c3b08b6f9bb8269b80f80ecb54725edf771db","observation_id":"4130b2f2-c369-4701-92c8-17251c0f8426","resolution":{"observed_at":"2026-05-14T19:09:23.183550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":"2402.18668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-07-09T12:46:14.690167Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":"cs.CL","work_id":"c542bc4f-de21-42d2-812b-b46f5fa9b434","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:c7c25e39881e2e74e9e1b61bc42ff39440f5a076025c73dea45f150abf032ebf","observation_id":"b70d82d9-3a87-4cb7-acb2-f4473fd7138f","resolution":{"observed_at":"2026-05-14T19:09:23.283089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05483","last_updated":"2024-07-07T19:55:09Z","snapshot_observed_at":"2026-08-02T03:13:14.123634Z","submitted_at":"2024-07-07T19:55:09Z","title":"Just read twice: closing the recall gap for recurrent language models","version":1},"cited_work":{"arxiv_id":"2407.05483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05483","snapshot_observed_at":"2026-07-04T19:30:07.247439Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":"0700c833-caaf-47d2-b97c-2f4a50eed025","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2407.05483","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:2cd39ab2037b5453c1f3e157b0925161e5ede1b455afe982697951f5f1a0035a","observation_id":"e38bb359-6662-46c6-8417-47f9135820ca","resolution":{"observed_at":"2026-05-14T19:09:23.225904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hinton, V olodymyr Mnih, Joel Z","venue":null,"work_id":"2acf842b-c183-4bfb-8391-2b456d531aa2","year":2016},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:2aea769b392241a3862cd1fd1ba95ec77315c94ed7def5a84f675c3ab80dfb49","observation_id":"c2cfc2a3-208e-4645-a033-3f52ef4553c1","resolution":{"observed_at":"2026-05-14T19:09:23.949163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"c19f0000-8c3f-4ed2-bfc0-993cc808152f","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:1bd3170a4947780c4a1b3fae14228df4c3d75cd6ca0028bb5e6d71843ce09613","observation_id":"90d7d37b-aeab-4297-a2e9-f35227bb54a8","resolution":{"observed_at":"2026-05-14T19:09:23.953091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online learning rate adaptation with hypergradient descent","venue":null,"work_id":"9dacd491-e48d-4826-9bd0-60e0baa4eb83","year":2018},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:59353ad1c944446b39c0f41f91b8a09a8c200156cc48ffb23ae9c524787c6949","observation_id":"14002096-691d-4596-a78a-17805a1fc268","resolution":{"observed_at":"2026-05-14T19:09:24.014234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xLSTM: extended long short-term memory.Advances in Neural Infor- mation Processing Systems, 37:107547–107603, December 2024","venue":null,"work_id":"cc2f88f1-9d16-4ea5-b681-e0c4557b8dd1","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:06f4e6e35eb8eeab2b95a4ba670e7906f84237d8d8c00e27c867e1148cbd775c","observation_id":"bb2fe9b5-60b8-4dea-bc30-330ce6385353","resolution":{"observed_at":"2026-05-14T19:09:23.998702Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Titans: Learning to memorize at test time","venue":null,"work_id":"6aa3cbd7-3a47-4421-96c1-7b117388a21a","year":null},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:c24766df26797bd01c374ed23444bb1cb29ab53d8008c62d92156c83d568ba32","observation_id":"44e8179c-f409-4d4d-bf8d-ca44c9cbd078","resolution":{"observed_at":"2026-05-14T19:09:23.936901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":"2501.00663","doi":"10.1016/j.est.2015.06.001","metadata_source":"pith","pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Titans: Learning to Memorize at Test Time","venue":"cs.LG","work_id":"fb2b7625-b733-43cb-af52-00b0a31a8d7f","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:9f75100b252cfa38041be8ff0280073ee9b86843a3bbfc37862fbe94a161af5b","observation_id":"237f0fb9-9ee6-4cd7-a77e-813b0bfb362d","resolution":{"observed_at":"2026-05-14T22:08:15.778565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T06:55:03.802588+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T06:55:03.802588+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:98c0a92c4f5ac729464e71deec7f126f3b89b9151e1275dfeb2fee1eeb8cef89","observation_id":"5fd9483a-c6aa-4b2c-8e1e-7c934fb8e84f","resolution":{"observed_at":"2026-05-14T19:09:23.240619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"d321262a-2994-4358-a03a-ef5bf3f80701","year":2020},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:93ecccfa874967245047a2bec4a7b2d1c346d0e47178aa31bcd9df11893cbe53","observation_id":"15c6c278-0837-4c55-b10b-fd2e35b0dce1","resolution":{"observed_at":"2026-05-14T19:09:23.949794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking attention with performers","venue":null,"work_id":"4fc1a585-50cf-49ce-90f4-b0e1c9d7a710","year":2021},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:1b9808cbc8706f95e1f17dfffbfbfe2b370345591f56a06338579ffa31623c9d","observation_id":"8a3da680-25c4-4eca-b9f0-7258c23ba42c","resolution":{"observed_at":"2026-05-14T19:09:23.990982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"309f004d-92c7-4bd8-80ee-c817167bd07b","year":2019},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:e7022f78b2ec2deb3daa3e136c1ee6b4c93822e4dbdd3ac629df33edd44864d9","observation_id":"62474e95-37bd-4868-90cf-fc891def6f33","resolution":{"observed_at":"2026-05-14T19:09:23.917970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:b1d43d3a73f98b2d01da3316f4df6875dee77ec81e836d24969cd6864840b8d4","observation_id":"affad8e8-2458-4085-97d6-e245a498668f","resolution":{"observed_at":"2026-05-14T19:09:23.235003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":null,"work_id":"949b1d35-3c1c-4a11-a684-f0787e5260b2","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:918bae69d2bfd6e7f1630828be101ce75a3808d6344e22a0bd478bdc74161764","observation_id":"c3699eb8-3392-46ab-9ec8-56c6370f882d","resolution":{"observed_at":"2026-05-14T19:09:23.908365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":"680eb67e-3030-42a0-97ab-d0296cf6d295","year":2019},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:0f305fea4072619b0b749a076c7719a487c286a6762bf42e2479af6cce51f035","observation_id":"9302ae87-b557-4940-b9e7-9d7ba4f41f7b","resolution":{"observed_at":"2026-05-14T19:09:23.912864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive subgradient methods for online learning and stochastic optimization.Journal of Machine Learning Research, 12:2121–2159","venue":null,"work_id":"290bb803-d712-4ee3-af4a-2864381afb52","year":2011},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:d5c6203f1a8987981ecba5a24b95043de426783374514762e49e6f82b6ea84a0","observation_id":"261f0bdb-ea38-4673-a90e-3a50b79ad56a","resolution":{"observed_at":"2026-05-14T19:09:24.064661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01803","last_updated":"2024-11-05T21:16:44Z","snapshot_observed_at":"2026-08-01T02:48:11.871788Z","submitted_at":"2024-11-04T05:04:18Z","title":"Gradient Methods with Online Scaling","version":2},"cited_work":{"arxiv_id":"2411.01803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01803","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient methods with online scaling.arXiv preprint arXiv:2411.01803","venue":null,"work_id":"9f6abc18-7c23-4163-8831-e07a370bd6b8","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2411.01803","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:7b27b9497a96b6964bec71093c1f55a8ea1a0cd284b37c41d092c423b2ec1536","observation_id":"179524cd-0c4a-4d1c-8fd8-5fd2e8f6b635","resolution":{"observed_at":"2026-05-14T19:09:23.271819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mamba: linear-time sequence modeling with selective state spaces","venue":null,"work_id":"727af383-4034-4e6d-bf4f-f52ea879df66","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:f192ffa6fc6aeeaa733f84171c9f6ca9ae094e9f32195bb269ce041c48d81bac","observation_id":"d39c2aca-6146-4d45-8312-18a2e3589c15","resolution":{"observed_at":"2026-05-14T19:09:23.932409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"c8d9c5e7-933a-4494-b672-efb543755589","year":2021},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:ae59d5ed76c3dba8c3d07f638eadc3aee31f5bcf4b16534a8da2c18b8e82eb1c","observation_id":"ded44fa2-29b2-4507-b841-b664f1650f56","resolution":{"observed_at":"2026-05-14T19:09:24.048416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"005ec7ab-d945-4e03-9e4b-6fde7df67c0a","year":2018},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:304816796d1aa7dfed4b0784025b47e657d14b11070e63bd90fe6e62fc017fb1","observation_id":"18483f44-47da-4b99-b044-4a32aedd418e","resolution":{"observed_at":"2026-05-14T19:09:24.052506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundations and Trends in Optimiza- tion","venue":null,"work_id":"93d02faa-73e1-46c4-8c9d-2d4ac32aed80","year":2016},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:baf8b28cf107dd65bbe0f0bcb75d90b348b1d4b0875d87be60b4d68d971be9e4","observation_id":"d2d86100-448d-4c90-bf2a-7c6ed1c0da7f","resolution":{"observed_at":"2026-05-14T19:09:23.894539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logarithmic regret algorithms for online convex optimization.Machine Learning, 69(2–3):169–192","venue":null,"work_id":"85fe4879-5213-403d-90d6-2df62ab01dac","year":2007},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:9d64bac3d100c428a4a33ea5498f864dfef36d95332a3d2f13bc6cf3f2da6928","observation_id":"8ab7e298-0eac-48b6-868f-43ebd07c5798","resolution":{"observed_at":"2026-05-14T19:09:23.966456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:07a0e83092da03ed482016f19e1f47c5c02b2f74ac10041f65cf1711fef8e383","observation_id":"e827a593-b678-41e4-b8a5-15afeea5ad62","resolution":{"observed_at":"2026-05-14T19:09:23.228532Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":"05c31330-e68b-4dca-b8d7-d19e7fd1c67c","year":2017},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:91abd7f1169b284204c2d1f96452742196475fbc23fde04095336a9f57bc24e0","observation_id":"c25b78e0-5af9-4fa5-9386-00c3081af1f2","resolution":{"observed_at":"2026-05-14T19:09:23.940588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.830","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"booktitle =","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"50e59f7a-cb5b-4d71-891d-af98df8b35a6","year":2021},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:5c7c755bf246ea5fa69193c1fd55c8b648ca35824db2d6cb2063d2b89b4dcc1f","observation_id":"e8c3b7dd-ee92-4eef-b3ea-9abab9a1f675","resolution":{"observed_at":"2026-05-14T19:09:22.586143Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are RNNs: fast autoregressive transformers with linear attention","venue":null,"work_id":"afa4466d-bb16-4826-9f65-b17f41e6bd74","year":2020},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:664f0a88cb830a03203429c7ef90a39594dc5e85cc5956850118b20541f6b737","observation_id":"3ee733c8-aef7-48f8-ab4b-f9e3181b24bc","resolution":{"observed_at":"2026-05-14T19:09:23.974524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.790648Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"961ef8a5-d589-421a-807e-e454fd585949","year":2015},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:5963209421528552c9e985ab17548596efad0f26372117ea9091a22d5fef3fa6","observation_id":"d219082e-92e4-44d8-bf8e-46034e0185f5","resolution":{"observed_at":"2026-05-14T19:09:24.073306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":"961610d1-1c7a-45ad-8f45-2247aba6b8ae","year":2019},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:240f2ddfa12a50fefd4758d39536250bc1d3c6972e73897a492e7f05b8eef956","observation_id":"c40e62bd-8d76-44cc-b068-d1c085ad3a5b","resolution":{"observed_at":"2026-05-14T19:09:24.077458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:57.815851Z","title":"Li, Berlin Chen, Caitlin Wang, Aviv Bick, J","venue":null,"work_id":"74e489b6-3a26-4e84-9578-7f3d90119238","year":2026},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:c4230570878e4d22ae7ef159ac947456db8e4b566579497d09b4023396b02ba2","observation_id":"0abf3c40-dc84-46f5-bb25-9da99d2d1d29","resolution":{"observed_at":"2026-05-14T19:09:23.196712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-04T14:58:56.675148Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":"2407.14207","doi":"10.48550/arxiv.2407.14207","metadata_source":"pith","pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hanxiao Liu, Zihang Dai, David R","venue":"cs.LG","work_id":"854578cf-e114-4bac-998f-a9ee9f8c7dc2","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:8cb4c25cba94ea33f3d32066df81b6df3be17fc62157c02d0ec64600f4a68689","observation_id":"10393e13-0256-4df2-9522-87773b16eea1","resolution":{"observed_at":"2026-05-14T19:09:23.289556Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:17:03.600265Z","title":"In: Zong, C., Xia, F., Li, W., Navigli, R","venue":null,"work_id":"8d675bdd-79ca-48d6-9163-fc17ce0e8ece","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:3cfa8f3ecf6730b19f3ac13d5593c0340e713a211b6130595d0d36e276f0abff","observation_id":"65e95bc5-4b78-41f3-b131-ea9bde0c8076","resolution":{"observed_at":"2026-05-14T19:09:22.579443Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.141805Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"11b009f0-d277-4043-b41f-45148f44bbef","year":2017},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:f320f9e6a2fd2b4d90b8094320a212b0cdfb9aa9a92d40de6c9ce8f8b593e5e9","observation_id":"4790f5bf-e1cd-4e5c-a8bb-5b990fbab71f","resolution":{"observed_at":"2026-05-14T19:09:24.056090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In-context learning and induction heads","venue":null,"work_id":"86c3c3af-0662-428d-a284-4f276aae079c","year":2022},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:be05abac1e229184b3cad6434056cb5010ba13a9dcf4143c4ad204eb1a1311d7","observation_id":"43e6314e-b06a-481e-a568-123b7e7c592b","resolution":{"observed_at":"2026-05-14T19:09:24.028750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Albert Gu, Anushan Fernando, Caglar Gulcehre, Razvan Pascanu, and Soham De","venue":null,"work_id":"eb0e1b91-8904-4654-9ea1-d0a540769839","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:beaebffaa20fda5600a02e1fa4b77ec9957974c168964552fa71dd79ad2e1b88","observation_id":"2db4ac37-a74c-4a38-a03a-9436ea3e6c61","resolution":{"observed_at":"2026-05-14T19:09:24.041138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"75f2ab17-26fd-43f8-b0f0-feb31506f3fd","year":2016},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:66fdb8c4901d4012de6d9a41a5f8a0949fe02165f33dbb3eb34b64a94ea81b88","observation_id":"7eae3ae3-d960-45f9-a90b-c91c4bac1fdd","resolution":{"observed_at":"2026-05-14T19:09:24.096467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eagle and finch: RWKV with matrix-valued states and dynamic recurrence","venue":null,"work_id":"bb0c38cb-f2b3-423a-bf1e-7d71c6327a12","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:ece6d1d6f5401f9733ab251b40ab179f0ee4e994e42349ebb03d4c7e09e88902","observation_id":"0a991653-d5d0-49f1-b695-27d69f554c88","resolution":{"observed_at":"2026-05-14T19:09:24.044428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-07-31T02:38:42.580244Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":"2503.14456","doi":"10.48550/arxiv.2503.14456","metadata_source":"pith","pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rwkv-7\" goose\" with expressive dynamic state evolution","venue":"cs.CL","work_id":"daf20308-c801-4745-a147-a1f1de4368e0","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:06ad55155af051da4e1258d782171dbb0529cbc440f8acd568e730e9e96d2219","observation_id":"253eead6-9ef8-4bb2-af6b-8f8835b8f9d3","resolution":{"observed_at":"2026-05-14T19:09:23.295141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Random feature attention","venue":null,"work_id":"a8fe277c-e771-4ec0-9984-565e4e9719eb","year":2020},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:55f3e3b7897df28037f2a2c18986e024acb94e74c0712dcbe0fd68584ff04c6c","observation_id":"90ff2b7d-c1e7-4477-a917-4d1171c6bee3","resolution":{"observed_at":"2026-05-14T19:09:24.006203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bb873c91-370f-433d-badc-ce63d5950d56","year":2022},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:57c208518b31ec7d734098c3c283d23fc804a4f922be9abd905f799975898472","observation_id":"fb995803-ed8f-4864-befe-b9bda40fc0ef","resolution":{"observed_at":"2026-05-14T19:09:24.029107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Tri Dao, Stephen Baccus, Yoshua Bengio, Stefano Ermon, and Christopher Ré","venue":null,"work_id":"7eb7d7c6-1822-49d6-917c-32b87f8385e7","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:d163eb1988cbef920cd0d267690e1befe26f91e199c96e41538f8172ad2f9c9e","observation_id":"859c6f3c-9a96-4af4-b80b-a18c542fd3a7","resolution":{"observed_at":"2026-05-14T19:09:24.033820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HGRN2: gated linear RNNs with state expansion","venue":null,"work_id":"59933b9c-26b3-4e5f-a57a-f9b333c8e554","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:9d4117dc14f57bb625497ce07e202bc059bf6a139ac8a97961e6ccc4cded817a","observation_id":"7f7c4942-5d6a-49ab-8c8c-810f9225274b","resolution":{"observed_at":"2026-05-14T19:09:24.037342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:c75c897958febec824a4e86272fb5007a587180884c1560516c52273246a4a34","observation_id":"160af0ae-55de-4745-a0d8-725a7434f862","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hopfield networks is all you need","venue":null,"work_id":"67fcdb29-badd-45e2-8b6a-da87cd0e461f","year":2021},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:6740f0027e4eda8f4030e2faeeeeda4ad2864eb8ec03140ddcfe94942791c833","observation_id":"e6512fbf-d4f7-4c70-adac-4f66723b4756","resolution":{"observed_at":"2026-05-14T19:09:24.091782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WinoGrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"a430a69a-7b8e-4b00-94e6-72868164d390","year":2021},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:dc263cdeeda173068031e5d7f3310db5bec26e8fc695af84d0540017b6bae20a","observation_id":"00e198ec-794f-4367-ae0f-14b44fa56640","resolution":{"observed_at":"2026-05-14T19:09:24.008839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SocialIQA: Commonsense reasoning about social interactions","venue":null,"work_id":"03d210cc-b102-445b-8ce6-394ca29f4b44","year":2019},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:5aee3d963f4d022d0a747747dd2fb14270876821a02e3d896a1edff8281932f6","observation_id":"dd31857a-82b6-4847-806a-db47e63430f6","resolution":{"observed_at":"2026-05-14T19:09:24.004235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear Transformers Are Secretly Fast Weight Programmers","venue":null,"work_id":"1e1630f2-7ab3-45a8-9e1d-ef5d54f38c1c","year":2021},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:26555addf93ae52bcd7d16aefb6490c49ff560d71059706f954610c1de1e5313","observation_id":"816370a2-13b1-4911-bc69-e6aba7ff2658","resolution":{"observed_at":"2026-05-14T19:09:24.016829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.455612Z","title":"Learning to control fast-weight memories: An alternative to dynamic recurrent networks.Neural Computation, 4(1):131–139","venue":null,"work_id":"862a421b-3843-409b-bfd7-de870fd8b860","year":1992},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:a6b501914b24c1606d3eb453926710d99ded7be7fbcb2f811a7ddb77104c8166","observation_id":"75f7db42-803c-4edf-a751-c531c7d76ea1","resolution":{"observed_at":"2026-05-14T19:09:24.040732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deltaproduct: Increasing the expressivity of DeltaNet through products of householders","venue":null,"work_id":"584b3078-2880-4440-9c92-ab0186c08a0e","year":null},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:6b8d8beb5853a2dfc5d3c9540c3fa09713cdf5342fad57d1fd8d10faaf4bc944","observation_id":"ed84d608-d368-4412-b36a-e11d03aabf11","resolution":{"observed_at":"2026-05-14T19:09:24.082072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.10297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:09:56.609775Z","title":"Deltaproduct: Im- proving state-tracking in linear rnns via householder products","venue":null,"work_id":"6b59ec97-773f-4e9c-b58f-13488ed5ed24","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:bb980d996e09e9c1700927c504727ab5fd93bc65abfe5dbf8ebea5b14f9d39a8","observation_id":"26dc1ab6-5a67-4805-b536-5d68d649c88a","resolution":{"observed_at":"2026-05-14T19:09:23.238354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c225813e-cc00-43d9-aa4f-46d7f4084e8b","year":2022},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:27a83da52c8672daa3725177b92fca39223825da6c302c47875f607e870e3773","observation_id":"817d1e65-64db-4cd0-b883-d27f292d2fbc","resolution":{"observed_at":"2026-05-14T19:09:23.979209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Andrew Warrington, and Scott Linderman","venue":null,"work_id":"a9ef058e-ad97-4002-a147-09f05766598c","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:2fc414c9ddfc459c4079062d3db025127fa65dd1753c34762529af6cc815961e","observation_id":"8af78a6c-adc6-4c04-99d8-2e553be7b690","resolution":{"observed_at":"2026-05-14T19:09:24.010548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":"2407.04620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-07-09T18:46:26.563289Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","venue":"cs.LG","work_id":"c682430c-e7a2-4699-b82d-55287448dbba","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:3794e433b9b1c6fa1ebe120b9099a778580b8e9bcb294c9961448eb2709fe917","observation_id":"e6240edb-6b75-4970-979e-c063b8ff49cf","resolution":{"observed_at":"2026-05-15T05:20:12.625336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:ec3a749cf8a2538b37c0812085ca90a0e3e7060dab3912bdbbdfaa5b138b8094","observation_id":"a6fe2de6-eb62-493e-a282-cc49789afb42","resolution":{"observed_at":"2026-05-14T19:09:23.250096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1fa3d0b1-97aa-4bff-aec2-33c93af3ea9b","year":1992},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:adc507f5375f75c9a5fabf3e6fa717b7f450877d14a8d0e3b4af61f86e182f1d","observation_id":"e761d600-933a-4fc7-852b-31713ddfe9d3","resolution":{"observed_at":"2026-05-14T19:09:24.024821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:78081c2a63af717f68d2e08812b7457f4832f1825c0846c4c033dfc8a5188e48","observation_id":"8ca0cdfa-c49d-4bc3-99bc-77bc73338eed","resolution":{"observed_at":"2026-05-14T19:09:23.258512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"bb9540ea-a11d-4103-aab3-2fcb017948ba","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:4707121e72f17b7b5d2060b6d76a8f21233c9cbdda8aff92b66d5cbcb459a22f","observation_id":"1361d8a7-4695-4e9b-8bb3-1fc76ada41be","resolution":{"observed_at":"2026-05-14T19:09:24.049149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05858","last_updated":"2024-10-15T13:43:50Z","snapshot_observed_at":"2026-07-06T16:17:11.839251Z","submitted_at":"2023-09-11T22:42:50Z","title":"Uncovering mesa-optimization algorithms in Transformers","version":2},"cited_work":{"arxiv_id":"2309.05858","doi":"10.48550/arxiv.2309.05858","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2309.05858 , year=","venue":"arXiv (Cornell University)","work_id":"db166848-a469-4cd5-9328-5fdf5f34d4f3","year":2023},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2309.05858","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:97dd1647c3186846cd4b500653120e7221e3edc628bb2e9639a0ddb4f6962e30","observation_id":"a94d68b2-39ea-47a2-b82f-ffad56a48db6","resolution":{"observed_at":"2026-05-14T19:09:23.215404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05233","last_updated":"2026-06-03T16:16:54Z","snapshot_observed_at":"2026-07-06T21:37:23.562748Z","submitted_at":"2025-06-05T16:50:23Z","title":"MesaNet: Sequence Modeling by Locally Optimal Test-Time Training","version":2},"cited_work":{"arxiv_id":"2506.05233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05233","snapshot_observed_at":"2026-07-04T19:30:07.288376Z","title":"Mesanet: Sequence modeling by locally optimal test- time training","venue":"cs.LG","work_id":"a56c0fb5-cd81-4e5e-982f-7cd7eef43563","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2506.05233","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:067eb513c56b8844b977eab680b66b5127523b1688375306d0e69273784fdeee","observation_id":"06ad3dd2-d404-4424-93ae-3790f54cf6ff","resolution":{"observed_at":"2026-06-04T02:07:39.171975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12352","last_updated":"2025-05-02T02:07:05Z","snapshot_observed_at":"2026-08-04T07:06:28.042736Z","submitted_at":"2025-01-21T18:32:31Z","title":"Test-time regression: a unifying framework for designing sequence models with associative memory","version":3},"cited_work":{"arxiv_id":"2501.12352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12352","snapshot_observed_at":"2026-07-04T19:30:07.279614Z","title":"Test- time regression: a unifying framework for designing se- quence models with associative memory","venue":null,"work_id":"cd562ae0-3a25-440b-897c-54d66eb3d6ff","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2501.12352","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:d8b3979bbaf79e006988b8f1df4d9f4abf0f1457447396e253387eb2e1e14716","observation_id":"d27565d6-7a06-4351-b610-aceb41d9680a","resolution":{"observed_at":"2026-05-14T19:09:23.253251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18510","last_updated":"2024-12-06T19:50:34Z","snapshot_observed_at":"2026-08-06T00:21:22.707014Z","submitted_at":"2024-02-28T17:38:06Z","title":"RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval","version":4},"cited_work":{"arxiv_id":"2402.18510","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18510","snapshot_observed_at":"2026-07-10T01:36:44.296965Z","title":"RNNs are not transformers (yet): The key bottleneck on in-context retrieval","venue":"cs.LG","work_id":"55ea4c0e-dff9-4216-af85-d89726fca9f2","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2402.18510","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:3f490fa6fc7f4bf4b4fa210154e8f7b446a1fc77fae43e4ad664c1cfe90c6cc6","observation_id":"078f8a98-665b-4ea6-94d4-91229a475bdf","resolution":{"observed_at":"2026-05-14T19:09:23.202619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":null,"work_id":"d6169986-360e-42cb-a476-6df1de2ab852","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:19cae467a0e38e9b830831df157507bdff9df58c4d36953420b5b981d401d552","observation_id":"a98f0758-2165-4080-96a3-83058677a9de","resolution":{"observed_at":"2026-05-14T19:09:24.037014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","venue":null,"work_id":"8c001618-a37a-474e-9bbb-2b5c91576d3d","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:f1fc7ab456673305afb41008e0ca6502826cb502524813929498dc390e4eed38","observation_id":"5cc6ed81-97c8-4b93-9656-21626eacdcc4","resolution":{"observed_at":"2026-05-14T19:09:24.053148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3668","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"43108a7e-1a66-452f-9a1a-194948f94c9f","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:f40ae389c7b90f12525fc5e7de10cec8c872990975763d3eb9702142ec5ddfe1","observation_id":"82f73bdf-b230-40b8-8b64-3994c7252bd2","resolution":{"observed_at":"2026-05-14T19:09:22.584072Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HellaSwag: Can a machine really finish your sentence? InAnnual Meeting of the Association for Computational Linguistics","venue":null,"work_id":"c8d282d6-0fbf-4e1e-9776-3dc74b0a2afb","year":2019},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:79f98b4c706e8aa45f78edb2603e8a350540288585635d8c04d314151d18b3f7","observation_id":"d7ebc376-0fc1-4393-804b-cf6ef047b5cb","resolution":{"observed_at":"2026-05-14T19:09:24.060990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated slot attention for efficient linear-time sequence modeling.Advances in Neural In- formation Processing Systems, 37:116870–116898, December 2024","venue":null,"work_id":"82f83f22-e48c-4b1c-840b-54cd4f1b19b7","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:389a3cb13bd1db0d6e95f9a2d04974034f2c791d444e18421b42d498ade26d91","observation_id":"29449d3a-20c7-4455-9524-cc5fde0b5d70","resolution":{"observed_at":"2026-05-14T19:09:24.069176Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online convex programming and generalized infinitesimal gradient ascent","venue":null,"work_id":"eda4ecb7-ed86-4790-83f7-6209a2cd00f3","year":2003},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:fb69400e32bcbcb67318aa96239ddec83641639bf6a26eeff8fd27c291b9447d","observation_id":"f6b706fa-e28f-483c-9104-1b30d3d72178","resolution":{"observed_at":"2026-05-14T19:09:24.057086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Since βt ∈(0,1) , the power-mean inequality givesP i(kt)4 i ≤ P i(kt)2 i 2 = 1","venue":null,"work_id":"8dec5ab7-7ad1-46fb-9a8b-d0a87887495f","year":null},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:bf6a1f34a9fe002372c56b1dcb2f92772ce44e69c26708742fc63abef0e68230","observation_id":"4a2d5b75-d98d-44e6-b79b-2435ce7907fe","resolution":{"observed_at":"2026-05-14T19:09:24.021041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional algorithmic regret.Let D ⊂R K be a closed convex set containing the algorithmic iterates {dt}","venue":null,"work_id":"8d92dfa5-2792-498d-bd18-77d966e4236b","year":null},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:a8bc5c80288148aa857d6ee44b7a5a4e0ae58b53a87f3891659062ce6073dc8c","observation_id":"096ded70-b4ed-4e4f-b10d-d6fbf0199858","resolution":{"observed_at":"2026-05-14T19:09:24.060482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"961f4111-731e-4d37-b24c-729aa33080d3","year":null},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:2ca388e8be26567a2dadf7d7702b283d6a33ba783d2b095834fd522763844d43","observation_id":"18fe0eb5-af9c-4db4-a87f-fc26f6cbab0e","resolution":{"observed_at":"2026-05-14T19:09:24.087457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8ba9eb2c-c82a-4755-88e6-12d605abe61e","year":null},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:48dd32f7b6dbc89ec97be5b34ef87db6f9f0c0aa56f1bf11110b5e7d048d8840","observation_id":"2b1e93e9-eaf7-48b3-bdcc-db00b5279902","resolution":{"observed_at":"2026-05-14T19:09:24.017926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3826.5626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"single” averages FDA, SWDE, and SQuAD, while “repeated","venue":null,"work_id":"d8fc497c-f232-4bec-b15a-b80a99b9b6e6","year":2048},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:1bf51ecd89e344e03ab50a5873989f0fbf1aa13c81471b1552ab807cf5aeffec","observation_id":"51724e93-1463-40e9-a015-4d167799979e","resolution":{"observed_at":"2026-05-14T19:09:23.216187Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":4,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":5,"verified_exact":16,"verified_fuzzy":42},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2605.13473."}