{"as_of":"2026-08-04T12:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0ce807e5f68937bb0458d78d68cd8c542cd8a0d0b10cd54431ac168c2f6bf5b","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:15:58.330766Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:37:54.272742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08587","snapshot_observed_at":"2026-08-01T02:37:54.272742Z","title":"Kaczmarz linear attention,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-01T14:23:07.610419Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.272742Z"},"links":{"cited_paper":"/paper/2605.08587","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:43e44a62b412f1253307fc9e843f417b407630334f235441badadc6a67435ce5","observation_id":"bd2b8ed1-0942-45dc-8c45-865fe8b6e8af","resolution":{"observed_at":"2026-08-01T02:37:54.272742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.08587/citation-record","integrity":"/paper/2605.08587/integrity","json":"/paper/2605.08587/citation-record.json","paper":"/paper/2605.08587"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:509fd84826d1e22f23629dcec8e2c36240a4db9e131e303b5ec4db1cf3293da1","observation_id":"488b3bd0-87c7-4c68-84a0-507ddf2cf080","resolution":{"observed_at":"2026-05-12T08:21:23.182840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":"1409.0473","doi":"10.48550/arxiv.1409.0473","metadata_source":"pith","pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-07-10T19:07:35.054881Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","venue":"cs.CL","work_id":"d831e763-d530-4029-a65c-ac595d82cb2a","year":2014},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:d7ef425e754c442a5579781715bb4c1b367d7bf95f68e2d6ee2d22d8467e840b","observation_id":"75ec204e-f1d5-4099-b28c-b6228e1df1d9","resolution":{"observed_at":"2026-05-12T08:21:23.192402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04517","last_updated":"2024-12-06T15:42:07Z","snapshot_observed_at":"2026-08-01T08:27:42.920637Z","submitted_at":"2024-05-07T17:50:21Z","title":"xLSTM: Extended Long Short-Term Memory","version":2},"cited_work":{"arxiv_id":"2405.04517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04517","snapshot_observed_at":"2026-07-10T01:36:43.972832Z","title":"xlstm: Extended long short-term memory","venue":"cs.LG","work_id":"cd8ee2fb-957f-4f9d-bdf9-e168fba4c2b8","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2405.04517","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:3f68c36abad73d9d8f849f471be269297b4bb28c1b915a9d50b7cd26d994d75d","observation_id":"d4488f3b-327f-47ee-8630-a297249281bc","resolution":{"observed_at":"2026-05-12T08:21:23.151720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":"0d165dec-f8d6-4812-acc9-cf4394ce9147","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:121206e0a4b3a954db3a714b615b8de92dc944b5084ab317bce4c27f100214dc","observation_id":"3b8fd592-7452-4953-8540-6b079a096b0f","resolution":{"observed_at":"2026-05-14T08:00:28.725876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-07-06T16:48:16.671370Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:cd057a278f2479ea316400c0da4ed0abe478116525e7f9f259370ee04c64d921","observation_id":"ec20bb38-ed73-44bd-b14f-3849e8e7b49c","resolution":{"observed_at":"2026-05-12T08:21:23.166304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-02T09:26:59.716070Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":"2009.14794","doi":"10.48550/arxiv.2009.14794","metadata_source":"pith","pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-07-11T01:47:47.727352Z","title":"Rethinking Attention with Performers","venue":"cs.LG","work_id":"4c26d308-8b72-4a98-8e73-950617a75f50","year":2020},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:f7d51e7bd62d352761b0a274e6c44db8b46f06e8bff170c14777642838bc0192","observation_id":"4ce4f730-1d40-4485-9f11-f0301da05e8a","resolution":{"observed_at":"2026-05-12T09:16:14.972905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-07-10T20:07:33.508131Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:d6fe3a3e599c3dd0b541ed3a4a76fd312bb9b36aa1d93ea7edabaea46276bced","observation_id":"ef36b515-f9ae-475d-aa61-3e292061e630","resolution":{"observed_at":"2026-05-12T08:21:23.175064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-10T21:57:38.573725Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:d92db697827116e1e659c103842c2c65462c0d73a4d4c215f9870eebc00a0766","observation_id":"a79e4cc9-7939-467e-a459-02a87b37ef58","resolution":{"observed_at":"2026-05-12T08:21:23.224692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":"2205.14135","doi":"10.48550/arxiv.2205.14135","metadata_source":"pith","pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":"cs.LG","work_id":"efa96825-0830-4cfc-a250-fdaf6af302ab","year":2022},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:a28f16957b413e135b172a767afbd0df781975fb8e65f7f496569aa6014e7c16","observation_id":"9dba6672-0bf7-453b-89d6-129297e4cf25","resolution":{"observed_at":"2026-05-12T16:22:09.323619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:f1d9be1438f2c6ea531752ab62d81149c613307b2545f3895d9cc6d0de340276","observation_id":"790946f8-6032-4a68-b1ba-7269b092e9e3","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-07-06T14:35:37.368351Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":"2212.14052","doi":"10.48550/arxiv.2212.14052","metadata_source":"pith","pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hungry hungry hippos: To- wards language modeling with state space models","venue":"cs.LG","work_id":"d5653b0c-f12c-4141-9343-d65df1fb4214","year":2022},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:41425387f0f5204d99f86c5111a301a04385a9c2c75fe9218f4b16135970bef4","observation_id":"6819593d-c1b8-4b6c-a4aa-59d4615e6b75","resolution":{"observed_at":"2026-05-12T08:21:23.294187Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:40.734258Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":"1f7d2019-1b29-4647-b064-a186683ce9ee","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:f8af06e9f241d3292511d5a3b4be307f15ff3fd28bf8e36c922b0784af675483","observation_id":"800e44fd-6061-444d-a0e5-dc6889aeb6ac","resolution":{"observed_at":"2026-05-14T08:00:28.733639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":"2111.00396","doi":"10.48550/arxiv.2111.00396","metadata_source":"pith","pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","venue":"cs.LG","work_id":"4150b761-b8bf-4d9b-a2f8-cb2d1b73d378","year":2021},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:5d36f585c92eac32910070a4d57cb91afbed793a4b83d38f765be114b3f7ebf7","observation_id":"d4cb94ab-672f-4435-ba6c-8763b4440997","resolution":{"observed_at":"2026-05-12T08:06:37.185943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.804512Z","title":"Log-linear attention","venue":null,"work_id":"9c67d35a-c055-4f41-862f-308bd2e3e832","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:cb5b7bb412522d87e4907df3a1e6588bc2b166005d48b06b6a1d152920aef4b5","observation_id":"e29bd68f-4ffa-4927-bbbb-53b49a3322e1","resolution":{"observed_at":"2026-05-12T08:21:23.263890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:d52677097281977f877cef294dfb7663e517cfa78a9a33ba9ab4469bc156e35c","observation_id":"e87883de-dce3-475b-a093-ca7e288db4bf","resolution":{"observed_at":"2026-05-12T08:06:37.538362Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Angenäherte auflösung von systemen linearer gleichungen.Bulletin Interna- tional de l’Académie Polonaise des Sciences et des Lettres, pages 355–357","venue":null,"work_id":"4f1acbca-0abb-4c4d-ba20-5adcb1ca3d8c","year":1937},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:267cdea132875b33cd7a22b0f86550161d061302b03a9ca9f59b462e41d72fa5","observation_id":"89e51c47-7a70-4bf6-9300-0fd39d26a80a","resolution":{"observed_at":"2026-05-14T08:00:28.731833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are RNNs: Fast autoregressive transformers with linear attention","venue":null,"work_id":"ee38e6a3-3913-4687-9a60-237abd8cca25","year":2020},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:a2575f4a47a3764ae8c3fe023395f2415f5852b09066d73d0dd1502ac4df16e0","observation_id":"07b61b21-ab60-4a2d-bd53-2af9708fd7df","resolution":{"observed_at":"2026-05-14T08:00:28.719921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01927","last_updated":"2024-01-27T14:52:52Z","snapshot_observed_at":"2026-07-06T16:42:40.074343Z","submitted_at":"2023-11-03T14:08:39Z","title":"GateLoop: Fully Data-Controlled Linear Recurrence for Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2311.01927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01927","snapshot_observed_at":"2026-07-04T16:09:56.603945Z","title":"arXiv preprint arXiv:2311.01927 , year=","venue":null,"work_id":"cdb0303e-f9ec-4458-b713-3f9cdb276f3d","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2311.01927","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:fbfe746dc4236dd5420ddfca4b883d36cfadc86585e080e12ac01368c9d2934c","observation_id":"ee756dc8-5df0-4f4b-8942-da09043d9b51","resolution":{"observed_at":"2026-05-12T08:06:37.006714Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-07-11T01:27:45.922878Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:8cfe5f7177bd88c28cfaa61747da9487ae2fafea849068b65619758689e2a0ee","observation_id":"bc7d02ff-9b72-490e-9f38-084bca80668b","resolution":{"observed_at":"2026-05-13T07:22:03.298150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":"2403.19887","doi":"10.48550/arxiv.2403.19887","metadata_source":"pith","pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","venue":"cs.CL","work_id":"129df0fe-8a66-4077-8991-3557cfa38274","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:2587f16160ba1673d3ccbedcb7fadb72cf8ba32421b84116133a8723160c1048","observation_id":"5c145e67-d908-4adf-b03f-5ebfe60361f4","resolution":{"observed_at":"2026-05-13T14:11:27.316872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02130","last_updated":"2025-03-31T19:41:52Z","snapshot_observed_at":"2026-07-06T20:46:09.097525Z","submitted_at":"2025-03-03T23:35:23Z","title":"Forgetting Transformer: Softmax Attention with a Forget Gate","version":2},"cited_work":{"arxiv_id":"2503.02130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.02130","snapshot_observed_at":"2026-07-04T03:29:30.170846Z","title":"Forgetting transformer: Softmax attention with a forget gate","venue":null,"work_id":"cc5197b5-1a1c-48c6-a2b9-498e8ac867ce","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2503.02130","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:f04f25a54dc8715578781dae9d574f5a210eec25e2825859af7a4944f12e9a08","observation_id":"89b5f006-9193-4076-ba99-9fc40fdb6625","resolution":{"observed_at":"2026-05-12T08:21:23.272020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-03T10:58:30.924742Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":"2407.14207","doi":"10.48550/arxiv.2407.14207","metadata_source":"pith","pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hanxiao Liu, Zihang Dai, David R","venue":"cs.LG","work_id":"854578cf-e114-4bac-998f-a9ee9f8c7dc2","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:e775d816edb1ccf73b4e564b5f7eb436bcc7805a2999445f27407cd8c16785dc","observation_id":"68bc9063-7575-4f79-a059-d7ae09b1c904","resolution":{"observed_at":"2026-05-12T08:06:37.727663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19370","last_updated":"2023-08-28T20:13:33Z","snapshot_observed_at":"2026-08-03T20:00:30.365863Z","submitted_at":"2023-05-30T19:25:51Z","title":"Blockwise Parallel Transformer for Large Context Models","version":3},"cited_work":{"arxiv_id":"2305.19370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.19370","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blockwise parallel transformer for large context models","venue":null,"work_id":"dc9be48a-cad4-46fc-a475-bdf9bb7ea390","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2305.19370","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:89515a574b98274bd63eafabfee8de0688520cbc734d6ffc26f3545e1a167c3c","observation_id":"d1e990bf-6f98-4396-bfee-7008d7b92a14","resolution":{"observed_at":"2026-05-12T08:21:23.313807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":"2305.13048","doi":"10.48550/arxiv.2305.13048","metadata_source":"pith","pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"RWKV: Reinventing RNNs for the Transformer Era","venue":"cs.CL","work_id":"524dc80d-f4ef-4f89-bf1a-9a8c1e4b6a81","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:875c99eff307a4b1baf2aa1fd2de903727d8a50a1cf648d80c731552bfcaa033","observation_id":"5cdbe56e-9cfd-4223-a82d-4f6a32ec3bdf","resolution":{"observed_at":"2026-05-13T10:53:42.104933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":"2108.12409","doi":"10.48550/arxiv.2108.12409","metadata_source":"pith","pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-07-10T20:07:33.543353Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","venue":"cs.CL","work_id":"145b1374-5258-4c00-a433-4db0f5a50749","year":2021},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:001faa1c4e3a2338db3499d5fdbfd702287c19feee1a3f8f1eb84675b59d4f7b","observation_id":"dec66d16-5ce7-43e7-8256-8843aa8c138c","resolution":{"observed_at":"2026-05-13T01:01:23.440331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17381","last_updated":"2024-06-20T09:12:42Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:38:13Z","title":"Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention","version":2},"cited_work":{"arxiv_id":"2405.17381","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17381","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Various lengths, constant speed: Efficient language modeling with lightning attention","venue":null,"work_id":"482af9d7-61e8-4d40-b8c7-3ccd1a1fa907","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2405.17381","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:7e592a4c08213e5b551f204b43f68ad66f4c3ff622e7512755ca1e678d1f4994","observation_id":"412a319a-d6de-4805-a392-d3db5e0ab7f9","resolution":{"observed_at":"2026-05-12T08:06:37.076986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.863377Z","title":"HGRN2: Gated linear RNNs with state expansion","venue":null,"work_id":"0c5ad441-1db3-4dd0-812d-1a207f739172","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:3a22002c2a41aed1c67113464854379fe2004534d84b180d7d51b3c72ec87618","observation_id":"431a6570-02c6-4fb9-81dc-a265a4e93a16","resolution":{"observed_at":"2026-05-14T08:00:28.710670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.815928Z","title":null,"venue":null,"work_id":"dbe0fbbe-5179-4af8-bab2-150896a7a573","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:9f598b27fdbb00500dc29b25ac523ab5c1ee3c41327168f19f6d4b4eb8d5eaf5","observation_id":"8c3addfd-b265-44fc-a7dc-0b60b18e9d9a","resolution":{"observed_at":"2026-05-14T08:00:28.721823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"c6284b0c-62a4-4dac-9f43-61e60bc1ecd6","year":2021},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:c7bacc25da6d589cafdd20e285331a156a309239b91653b4bb9a9ffdbbe8eea6","observation_id":"b9eecb19-db66-42f0-88fa-a3c8e50662ba","resolution":{"observed_at":"2026-05-14T08:00:28.737232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco.1992.4.1.131","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:49:15.636009Z","title":"Arnab Sen Sharma, David Atkinson, and David Bau","venue":null,"work_id":"4d506627-035c-4c55-8ce2-e6caf494d405","year":1992},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:c46c7a56c90dc33d4b23f8d784bb72923efbf3b2313021c6888b7e7f055f2396","observation_id":"2a1b4010-f413-49bd-b5dc-38654a05252b","resolution":{"observed_at":"2026-05-12T01:16:13.606737Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03533","last_updated":"2022-10-11T21:30:28Z","snapshot_observed_at":"2026-07-06T12:26:09.094759Z","submitted_at":"2022-01-10T18:47:15Z","title":"SCROLLS: Standardized CompaRison Over Long Language Sequences","version":2},"cited_work":{"arxiv_id":"2201.03533","doi":"10.48550/arxiv.2201.03533","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.03533","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scrolls: Standardized comparison over long language sequences","venue":null,"work_id":"0f2addb8-4f68-4fe3-9ceb-441f49d80c7e","year":2022},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2201.03533","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:bb1be458a7f04e259e3f5b0737f67c20b2192cd6887f40e29cc5d769990866d2","observation_id":"c88de38d-dcfd-4569-9683-edfff137e899","resolution":{"observed_at":"2026-05-12T08:06:37.876868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-07-11T03:27:46.785958Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:8db68ec4b80098f0fb7e8bf728410e7293cb543127fd0aac31dbeeec2143f5a2","observation_id":"f4936eda-d3e9-409c-87c0-0dadebc44e6d","resolution":{"observed_at":"2026-05-12T08:21:23.305965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.10297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:09:56.609775Z","title":"Deltaproduct: Im- proving state-tracking in linear rnns via householder products","venue":null,"work_id":"6b59ec97-773f-4e9c-b58f-13488ed5ed24","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:1d45b66c898f4cb49c391baedc861e57ab42a677354ec132ad2570cf23920042","observation_id":"3cc27689-d997-4b90-8c9c-7d16b9e23b55","resolution":{"observed_at":"2026-05-12T08:21:23.300326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Andrew Warrington, and Scott Linderman","venue":null,"work_id":"21afe912-c4f3-4110-a161-5ff17e8d5392","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:b2863536953eb3a80628ca0d23074bae0486b9f4ed8e103aade65f5748f95093","observation_id":"680eb6e0-4d40-40d1-bdd4-fef794c97514","resolution":{"observed_at":"2026-05-14T08:00:28.723727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1702a76a-8cf4-44d1-aa33-40e8c678845a","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:e71297e771f01b54e2a2822297102836aef527e81fcceb8d6663bb884207b943","observation_id":"3b31006d-d0bf-4d17-a1d9-7782c8a55687","resolution":{"observed_at":"2026-05-14T08:00:28.716036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:56.157460Z","title":"SlimPajama: A 627B token cleaned and deduplicated version of RedPajama","venue":null,"work_id":"b3294508-8775-43e4-9d4e-fc20a048c388","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:4c0847bd094dc59b56c0f618c72bcaad9774a72c1066ab310b55d030a1684535","observation_id":"3ee30090-fa31-4b5e-9e3c-af1e5f679abe","resolution":{"observed_at":"2026-05-14T08:00:28.708501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:56.159377Z","title":null,"venue":null,"work_id":"4177ef57-1877-4c67-8a1b-fae3c86ad2ef","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:52c0daed8200033173de9056dd2659b26762f556f012f86190647e0ee9c27efe","observation_id":"7d037635-a517-4c37-9a90-c803e993a3d5","resolution":{"observed_at":"2026-05-14T08:00:28.738932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":"2407.04620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-07-09T18:46:26.563289Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","venue":"cs.LG","work_id":"c682430c-e7a2-4699-b82d-55287448dbba","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:28f82f0312b10ce1483d11fdef067a30037871fe1e85054aea1820ae09df200b","observation_id":"af6bb611-a6b7-4b67-a806-462d7acb4039","resolution":{"observed_at":"2026-05-15T05:20:12.625336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:4707f8031564f305cabab8a2b6538746233eff7d3cfca57aa95ff2226aabc769","observation_id":"c42e0cde-37eb-451b-af32-51e66bb9e219","resolution":{"observed_at":"2026-05-12T08:06:37.347135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:26bd746065084713d5ea6872afac1a05152a6fc0548ce21e5fdf65b5b1e41316","observation_id":"8bf2528d-210e-4da0-9aec-68f888328d81","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:0e5e9c642165c331fffcc3896a9680757f4e86002a1ab8db79ef26e02c51f657","observation_id":"05a75499-16d4-47ab-ba68-2894bb5a2583","resolution":{"observed_at":"2026-05-12T08:21:23.320498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"2eafee79-d6e6-46b6-9f4a-9696b1b12f56","year":2017},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:eeaa678d004120a5ed339731c58163ecad8fb722ec964525bdbf66c207759c74","observation_id":"7fafa2b4-131e-4efe-9edf-503913b84a55","resolution":{"observed_at":"2026-05-14T08:00:28.735267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":"2406.07887","doi":"10.48550/arxiv.2406.07887","metadata_source":"pith","pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"An Empirical Study of Mamba-based Language Models","venue":"cs.LG","work_id":"7a48323c-5291-43c0-93ea-ac7a32dd7fef","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:810d94f6376be108adeb1c40a10752b380e3989c143139a1e7ee97da6450e28c","observation_id":"f8821bfb-31b6-4fbf-9a9e-2c42782d8080","resolution":{"observed_at":"2026-05-18T10:31:04.038637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12352","last_updated":"2025-05-02T02:07:05Z","snapshot_observed_at":"2026-08-04T07:06:28.042736Z","submitted_at":"2025-01-21T18:32:31Z","title":"Test-time regression: a unifying framework for designing sequence models with associative memory","version":3},"cited_work":{"arxiv_id":"2501.12352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12352","snapshot_observed_at":"2026-07-04T19:30:07.279614Z","title":"Test- time regression: a unifying framework for designing se- quence models with associative memory","venue":null,"work_id":"cd562ae0-3a25-440b-897c-54d66eb3d6ff","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2501.12352","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:1ba106c620096ab53d1b2946bc8d0e1b68e61115450a55a80b8dd3e8fbc8d9cb","observation_id":"1c0b7488-6b92-40cf-b436-2607b5459681","resolution":{"observed_at":"2026-05-12T08:06:37.408796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":"2006.04768","doi":"10.48550/arxiv.2006.04768","metadata_source":"pith","pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Linformer: Self-Attention with Linear Complexity","venue":"cs.LG","work_id":"4b717b51-6098-45d0-8e9e-b69bef651bc3","year":2020},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:ce3febef832921ef0cb18e685a2d468ef0de3404e4858da682791ed4f1757fed","observation_id":"0ac175f7-1e77-4613-9622-2c0c01200aa5","resolution":{"observed_at":"2026-05-12T08:21:23.231682Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fla: A triton-based library for hardware-efficient implementa- tions of linear attention mechanism, January 2024","venue":null,"work_id":"3fa5e54f-337a-4936-be6d-a445f03e9f0d","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:ff2b89f49d8af311f8170417baddf75d1a25c9da36a061d2b2a49f0465061dde","observation_id":"05e8f422-c446-4abe-9e8f-02ca92d16397","resolution":{"observed_at":"2026-05-14T08:00:28.714447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":"65d03884-e123-45ab-ad2e-3cf5e27070cd","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:120c69dc4bacae30a5dfb2de8201ef3d15579904edad29b25a710d5e6d31e4e7","observation_id":"b9ad8e83-d086-46e3-ac2d-159f21ce969b","resolution":{"observed_at":"2026-05-14T08:00:28.712548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"827bfb59-15c0-4606-aaca-a8643d6f92d6","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:014a395ad5b4588838a4b520ff863a2f9973ae1cc6e61431856124ee62a0a763","observation_id":"80f37d7f-f3ac-4ade-b585-cdbb94e9752c","resolution":{"observed_at":"2026-05-14T08:00:28.728252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.813449Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":"78bd411e-b993-4dfa-9848-e075ad159e4f","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:7bc94e9c5392210d7d0f2a1a9a057130412e83c9582fd295a954058b1b38e4c0","observation_id":"6645ea7a-801c-4c94-8384-23009042500f","resolution":{"observed_at":"2026-05-14T08:00:28.717869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14062","last_updated":"2021-01-08T07:41:50Z","snapshot_observed_at":"2026-07-06T09:42:23.296738Z","submitted_at":"2020-07-28T08:34:04Z","title":"Big Bird: Transformers for Longer Sequences","version":2},"cited_work":{"arxiv_id":"2007.14062","doi":"10.48550/arxiv.2007.14062","metadata_source":"pith","pith_arxiv_id":"2007.14062","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Big Bird: Transformers for Longer Sequences","venue":"cs.LG","work_id":"605bd800-a1a3-4bcc-b188-604145af1773","year":2020},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2007.14062","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:8dde0b2b416c2fc4b0a9044f2914ed2bb4d83943e37f79a417678a0a682096cb","observation_id":"a433a428-2355-4166-bb30-cc52a7041136","resolution":{"observed_at":"2026-05-17T01:54:01.139247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:04.522608+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:04.522608+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14103","last_updated":"2021-09-21T18:04:55Z","snapshot_observed_at":"2026-07-06T11:13:51.821442Z","submitted_at":"2021-05-28T20:45:30Z","title":"An Attention Free Transformer","version":2},"cited_work":{"arxiv_id":"2105.14103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.14103","snapshot_observed_at":"2026-07-04T10:29:45.024670Z","title":"An attention free transformer","venue":null,"work_id":"49358264-ed48-4ca7-9326-d1365796f89a","year":2021},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2105.14103","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:8b4d0f71a8fcc207e747a2ad51c3285ea5514f8671aa16ae0beea4c12a4be659","observation_id":"cef2bcc6-5f72-4e78-9bae-e8851b5fd0aa","resolution":{"observed_at":"2026-05-12T08:06:37.296952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23884","last_updated":"2025-05-29T17:50:34Z","snapshot_observed_at":"2026-08-02T10:36:55.936254Z","submitted_at":"2025-05-29T17:50:34Z","title":"Test-Time Training Done Right","version":1},"cited_work":{"arxiv_id":"2505.23884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23884","snapshot_observed_at":"2026-07-09T18:46:26.540032Z","title":"Test-Time Training Done Right","venue":"cs.LG","work_id":"12c91551-57e9-44df-bd50-62bbfc4b6f67","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2505.23884","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:b2ad7f539cdb20912fb871e0903599acbbe9a211a7915c14d8b8326fda1bfcae","observation_id":"faed409e-e18c-48bb-a118-9d6906b94ed3","resolution":{"observed_at":"2026-05-16T11:25:45.463576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07146","last_updated":"2024-10-31T13:54:35Z","snapshot_observed_at":"2026-07-06T19:13:42.074230Z","submitted_at":"2024-09-11T09:49:50Z","title":"Gated Slot Attention for Efficient Linear-Time Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2409.07146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.07146","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated slot attention for efficient linear-time sequence modeling","venue":null,"work_id":"a389c560-234c-44e6-86ea-8d11aec8d2be","year":2024},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2409.07146","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:94078d599ad39b61b3ce33ff300261981d51972f9808a5a2e90398147c8049f5","observation_id":"cedef059-247c-44ac-ae78-1b9d416379f1","resolution":{"observed_at":"2026-05-12T08:21:23.332884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learned Scalar","venue":null,"work_id":"0706895c-a09f-40cd-ac1c-8c45acc366f6","year":null},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:8f420e8413b84a736d5d56726730690fb21d2f2471985b0a8678c302ef04a6de","observation_id":"988c5015-7b15-4e47-9fc6-f5c0eb1d7685","resolution":{"observed_at":"2026-05-14T08:00:28.729977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":3,"verified_exact":27,"verified_fuzzy":14},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2605.08587."}