{"as_of":"2026-08-05T02:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4065931f4adada676e8957595c4d7253994cc0dd14e074293bb297307e8ae4a2","coverage":[{"denominator":129,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T23:49:10.555255Z","state":"measured"},{"denominator":183,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":183,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":83,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:34:56.804544Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T14:57:14.481929Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:23.826110Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2511.21016"},"observation_digest":"sha256:e67e5b40de1c6fe67de7867f1ce012d8b23eaefa2dcbd58f036813a6345bb010","observation_id":"65880f4a-7385-4491-b9c4-bcd6ac9dd8cf","resolution":{"observed_at":"2026-05-21T18:00:27.154465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-04T06:42:11.328087Z","title":"Kimi linear: An expressive, efficient attention architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15038","last_updated":"2026-08-02T11:54:24Z","snapshot_observed_at":"2026-08-05T01:17:57.672020Z","submitted_at":"2025-12-17T03:03:40Z","title":"LADY: Linear Attention for Autonomous Driving Efficiency without Transformers","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T06:42:11.328087Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2512.15038"},"observation_digest":"sha256:2db7d2893ea57b005e8d1ccc69f0f7a3689e7a30d8984c7545e6562c31b114e8","observation_id":"4c1ace1b-38cd-492d-af25-fb949571089d","resolution":{"observed_at":"2026-08-04T06:42:11.328087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-03T04:55:41.655757Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv:2510.26692 [cs.LG],","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03681","last_updated":"2026-06-02T17:25:15Z","snapshot_observed_at":"2026-08-03T04:55:39.986463Z","submitted_at":"2026-02-03T16:02:50Z","title":"Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:41.655757Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2602.03681"},"observation_digest":"sha256:0b84a977132c1b9835d2c80579cf3502a8dfaa815a8f5b1d3703252c699b4489","observation_id":"15471047-c78b-4ed7-9a0d-2c02d799d208","resolution":{"observed_at":"2026-08-03T04:55:41.655757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2602.08064","last_updated":"2026-05-21T09:52:18Z","snapshot_observed_at":"2026-08-04T01:56:43.373244Z","submitted_at":"2026-02-08T17:17:56Z","title":"SiameseNorm: Breaking the Barrier to Reconciling Pre/Post-Norm","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T11:11:51.440058Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2602.08064"},"observation_digest":"sha256:79a0defce84baeaf5c521c184fa53f3e083c8551b0f0af56f55393fe6f5a3369","observation_id":"e4f03d44-570b-4f54-9126-b46c9d6f5e23","resolution":{"observed_at":"2026-05-22T11:14:47.973288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2602.14814","last_updated":"2026-06-25T13:57:14Z","snapshot_observed_at":"2026-08-03T04:41:03.080168Z","submitted_at":"2026-02-16T15:07:51Z","title":"Learning State-Tracking from Code Using Linear RNNs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T21:46:14.287966Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2602.14814"},"observation_digest":"sha256:5d245c554555e89028d2e4e9935c5c9c8287869628a0a08714c967ade7da88de","observation_id":"955e078b-52e1-4ca1-8981-6d06963b76a5","resolution":{"observed_at":"2026-05-15T21:46:42.351249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-02T23:07:49.480563Z","title":"Kimi linear: An expressive, efficient attention architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14814","last_updated":"2026-06-25T13:57:14Z","snapshot_observed_at":"2026-08-03T04:41:03.080168Z","submitted_at":"2026-02-16T15:07:51Z","title":"Learning State-Tracking from Code Using Linear RNNs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T23:07:49.480563Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2602.14814"},"observation_digest":"sha256:6182aa88f86b544cbcbfdf6ce869d04d2963ca8b0b43a8add71ec0a622f49784","observation_id":"c7fd4020-8525-4152-ae3a-41aaa0de387b","resolution":{"observed_at":"2026-08-02T23:07:49.480563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2602.21204","last_updated":"2026-05-12T22:37:21Z","snapshot_observed_at":"2026-08-03T04:44:07.548954Z","submitted_at":"2026-02-24T18:59:30Z","title":"Test-Time Training with KV Binding Is Secretly Linear Attention","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T19:40:35.854519Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2602.21204"},"observation_digest":"sha256:de184312206c702cccae12e2081be48c9953014e46b5d5bb638d5cb9ed2afb09","observation_id":"811f1597-f2bd-45f1-83a5-0bea202cf12c","resolution":{"observed_at":"2026-05-15T19:41:32.771173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-02T19:12:04.686139Z","title":"10 Why are Linear RNNs More Parallelizable? Gonzalez, X., Buchanan, E","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.03612","last_updated":"2026-06-01T21:33:41Z","snapshot_observed_at":"2026-08-02T19:12:03.046542Z","submitted_at":"2026-03-04T00:51:08Z","title":"Why Are Linear RNNs More Parallelizable?","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T19:12:04.686139Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2603.03612"},"observation_digest":"sha256:3791d6fbe904a362e2eaeaeb620401029564ceb9313bb055a54470aee6ae3f8f","observation_id":"82209866-5495-4f73-93cd-e3b4ad7af351","resolution":{"observed_at":"2026-08-02T19:12:04.686139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:e457abc4ee7dbb2437bf774a9a6efbb5e398e88d5ff4230f11139a34f85e404f","observation_id":"7c9cf6dc-8503-4aa4-8453-83e63a5621bf","resolution":{"observed_at":"2026-05-21T06:39:04.478018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-02T17:21:21.475017Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26556","last_updated":"2026-07-17T10:32:57Z","snapshot_observed_at":"2026-08-02T17:44:09.276781Z","submitted_at":"2026-03-27T16:16:23Z","title":"When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T17:21:21.475017Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2603.26556"},"observation_digest":"sha256:cb0d788912edf94b86584d70f7e076353b3fc035be056113519ff862c1cd1bd4","observation_id":"442ad456-ac9c-451e-8061-b757216e3775","resolution":{"observed_at":"2026-08-02T17:21:21.475017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.03263","last_updated":"2026-03-12T21:21:51Z","snapshot_observed_at":"2026-07-06T22:52:29.705312Z","submitted_at":"2026-03-12T21:21:51Z","title":"LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T11:22:08.937342Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.03263"},"observation_digest":"sha256:ff9025da036fd9b10eaab1659f4cb28ec5723743e46ab227a23426629e3cde91","observation_id":"d991f051-db19-4d3a-a9ff-a8fdeb2a2fb5","resolution":{"observed_at":"2026-05-15T11:25:31.092475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.05688","last_updated":"2026-04-07T10:40:16Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:40:16Z","title":"Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T19:47:34.869184Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.05688"},"observation_digest":"sha256:11ca05099315a3a0232ad024028181e83a0544a7aae4e34f1a74141eb956ef2c","observation_id":"c0c818a3-d5a4-44eb-b81f-9f332726c129","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.07279","last_updated":"2026-04-08T16:41:22Z","snapshot_observed_at":"2026-07-06T22:55:33.502756Z","submitted_at":"2026-04-08T16:41:22Z","title":"Mem3R: Streaming 3D Reconstruction with Hybrid Memory via Test-Time Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T18:32:42.456629Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.07279"},"observation_digest":"sha256:5aa7ab92f240ae9f4e7cd9a6f9224c67469f2bbbdc3eafd22372aa4c95599b4c","observation_id":"5f27620f-5b2d-4ca6-b20c-7086603c2e58","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:6f96199b116ef244341c6b70c41a602f69a399d70c304067555d84d8f221a0e8","observation_id":"de6dd072-f4d6-4212-b67c-d5e29b8340ac","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.10103","last_updated":"2026-04-28T08:33:18Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T08:54:07Z","title":"Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:54.363560Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.10103"},"observation_digest":"sha256:2c0175cc5f8012799946ec83b86c41739cc70909896b29c8f0fef14dba9861c3","observation_id":"3464b2cd-7eba-4619-9c7b-73360bcb2e1c","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.14922","last_updated":"2026-04-16T12:06:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T12:06:59Z","title":"LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T11:17:43.769244Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.14922"},"observation_digest":"sha256:5a120a7fa62d33d3ca540f90c76a423bf9f8d37bc3f7ae329bb8e655bf9cbe5a","observation_id":"db989a8b-4eba-46ad-864b-788b1755bb8d","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.15039","last_updated":"2026-04-22T03:05:12Z","snapshot_observed_at":"2026-07-06T23:02:40.364114Z","submitted_at":"2026-04-16T14:07:41Z","title":"Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T10:01:41.739908Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.15039"},"observation_digest":"sha256:27ae1c26a31563dbf0dd9b187da7641148f79ed4b428addb67caccdd13a6c140","observation_id":"28b51f7f-3c93-4b31-945c-5b7aaf2481a3","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:10f37404f6f17e58a4f887d2c2f02d0255ce49779b1781390a0d0da7d165ca0e","observation_id":"689b5af6-e7a3-48db-8b59-6c774e36567a","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.21100","last_updated":"2026-04-22T21:38:25Z","snapshot_observed_at":"2026-08-02T18:50:20.662385Z","submitted_at":"2026-04-22T21:38:25Z","title":"Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-10T00:19:24.366922Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.21100"},"observation_digest":"sha256:aee7cec21fa824693a50f0154cdb2321fe9102fdb9ce1baed95eb7bf0d02aa36","observation_id":"e11f0bb1-903b-4607-9d15-8bfde70e33b8","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.22575","last_updated":"2026-04-24T14:07:54Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:07:54Z","title":"SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:18:23.898779Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.22575"},"observation_digest":"sha256:693fea584db9909d1f6e84efcfbac2e9c51f9951b2929a7f7214f96b4e4b01a9","observation_id":"3ced6f9d-a599-4bd0-8e82-62244d9af53f","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.22782","last_updated":"2026-04-03T14:56:17Z","snapshot_observed_at":"2026-08-02T15:24:09.520492Z","submitted_at":"2026-04-03T14:56:17Z","title":"Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T19:56:48.015363Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.22782"},"observation_digest":"sha256:fb183602c4eef4efa8dbf78c56cbf594737a7272f2b3a7df7c46e796ef9adcb6","observation_id":"d93bf77b-c884-4512-960f-d3027ae1ccc6","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.24715","last_updated":"2026-04-27T17:23:37Z","snapshot_observed_at":"2026-08-02T10:33:56.860167Z","submitted_at":"2026-04-27T17:23:37Z","title":"Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:37.485602Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.24715"},"observation_digest":"sha256:d5b9be2a41c05d2bdc3a74670ea4bd071ddad99913da026d5ca185791c8ac3d6","observation_id":"fd6e21aa-18a7-4f15-8b5d-bf1ada0bdf94","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.27351","last_updated":"2026-04-30T03:02:27Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T03:02:27Z","title":"Heterogeneous Scientific Foundation Model Collaboration","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-07T08:50:05.980191Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.27351"},"observation_digest":"sha256:911176d7d379bcdf169f6303108f06c691a831ac99355a4de3d84447ceaec3ca","observation_id":"1e07b722-6554-4fb6-b79f-ffaba45d8bc5","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.05696","last_updated":"2026-05-07T05:36:03Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:36:03Z","title":"Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T05:37:02.419657Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.05696"},"observation_digest":"sha256:0908cde3c6fe0c714262adc539981bf57052430d3212fc4773642a2f3d6d38a9","observation_id":"7cc04cf2-11cb-4abb-83ee-0371e383c955","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:874c5424bfe270c5e9b10790ae30a9086aacc052cf3f7e15b92f3c1a6b88b46a","observation_id":"826d8c55-c425-4196-8de9-e26fa2671c05","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.06221","last_updated":"2026-05-07T13:18:08Z","snapshot_observed_at":"2026-08-04T15:36:16.480613Z","submitted_at":"2026-05-07T13:18:08Z","title":"UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T10:43:01.724760Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.06221"},"observation_digest":"sha256:f30102c90473df682f78b8dd4fae19d33f88cc1405b885074156b86d949f0ef7","observation_id":"057d2c3b-4551-4afe-b105-39c128274991","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.07588","last_updated":"2026-05-08T11:02:11Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:02:11Z","title":"Revisiting Transformer Layer Parameterization Through Causal Energy Minimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:17:32.226166Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.07588"},"observation_digest":"sha256:a4ebaf4f2591deb6db11ffdbd9795a3bedce22a5bd04a8c2865f1a982dafa48b","observation_id":"6363b622-fe19-4bf2-b594-a1f6b0f6ab99","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.08587","last_updated":"2026-05-09T01:07:01Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T01:07:01Z","title":"Kaczmarz Linear Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:58.330766Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.08587"},"observation_digest":"sha256:26bd746065084713d5ea6872afac1a05152a6fc0548ce21e5fdf65b5b1e41316","observation_id":"8bf2528d-210e-4da0-9aec-68f888328d81","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-05T01:15:42.514290Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-12T01:28:46.885635Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:06811233d49115bc4c9075bba4c4c51c068995f609ff7721dccff5cd39617310","observation_id":"93db9185-49d1-429c-a0fe-4987f5c124ac","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-05T01:15:42.514290Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-20T23:27:20.754475Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:08ce1267691d0f3cf413c24d5616a98c957a402d269986556f7202440dd4fd11","observation_id":"5d514b23-d499-4a89-9ec5-6792b7e6a869","resolution":{"observed_at":"2026-05-20T23:29:12.887664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-05T01:15:42.514290Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-30T23:31:48.469869Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:6b47a1d42bbcccc22b8e8724e7a14e23e9838c04a8620ea0d11e72803fc33daa","observation_id":"82a8f3d5-0e84-48a7-98d9-e481335efde5","resolution":{"observed_at":"2026-06-30T23:35:07.322917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-04T05:19:07.559006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08696","last_updated":"2026-07-31T21:33:57Z","snapshot_observed_at":"2026-08-05T01:15:42.514290Z","submitted_at":"2026-05-09T05:07:55Z","title":"Structured Recurrent Mixers for Massively Parallelized Sequence Generation","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T05:19:07.559006Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.08696"},"observation_digest":"sha256:2b820921a52b73b9135d365d6add01d553a4b1d09e20501f7029079677328839","observation_id":"dfc18780-d4cb-490d-9061-9f2eeb6e69c4","resolution":{"observed_at":"2026-08-04T05:19:07.559006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.10537","last_updated":"2026-05-11T13:20:51Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:20:51Z","title":"Mela: Test-Time Memory Consolidation based on Transformation Hypothesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:01.993926Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.10537"},"observation_digest":"sha256:5ac5392f1443227d3211cdc271226a958de81a92a2dbb07c951544ca6b27e19c","observation_id":"02d26702-20f5-4fea-bb0a-e9da57ba7f4c","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.12357","last_updated":"2026-05-12T16:31:44Z","snapshot_observed_at":"2026-08-02T05:52:00.808241Z","submitted_at":"2026-05-12T16:31:44Z","title":"$\\delta$-mem: Efficient Online Memory for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T04:08:34.936172Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.12357"},"observation_digest":"sha256:1ce50fcbb49c4cc389e0880f91a7f426cd75a7868bc9c6f2e05ac67dea38ae4a","observation_id":"934c8fe1-081e-45b6-8bad-f41301499ccd","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:de57d31221d18635886f20f0d07e4d21da9fa5bdd484029ceabbf6f5f54ff0d4","observation_id":"8ca0cdfa-c49d-4bc3-99bc-77bc73338eed","resolution":{"observed_at":"2026-05-14T19:09:23.258512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.15178","last_updated":"2026-05-14T17:58:03Z","snapshot_observed_at":"2026-08-01T20:39:32.341477Z","submitted_at":"2026-05-14T17:58:03Z","title":"SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T13:56:17.912350Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.15178"},"observation_digest":"sha256:322ac277ff52d1f2e1b597f6ad97f24c98efd360d7a99d65cc0b02ec9b68e517","observation_id":"9f0af75d-f0be-47a4-a3d6-9783eea5be53","resolution":{"observed_at":"2026-05-15T14:00:03.388528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.16928","last_updated":"2026-06-08T02:38:05Z","snapshot_observed_at":"2026-08-02T02:41:46.596895Z","submitted_at":"2026-05-16T10:51:58Z","title":"Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T20:51:29.740033Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.16928"},"observation_digest":"sha256:2d9ea024aac348769b5fbb8585486c75a92101a5dfb4b34f5c6e237e4efe457f","observation_id":"9ab313f1-05a1-4899-a713-d4bd5d357f0e","resolution":{"observed_at":"2026-05-19T20:52:46.060876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.16928","last_updated":"2026-06-08T02:38:05Z","snapshot_observed_at":"2026-08-02T02:41:46.596895Z","submitted_at":"2026-05-16T10:51:58Z","title":"Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T19:17:28.300961Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.16928"},"observation_digest":"sha256:40295464309e4db4d94d11dcf3f8928dde120a3bd48d63fd627521ebca7916fe","observation_id":"5a442d03-9384-45bb-87b9-5b0b8ba0ce19","resolution":{"observed_at":"2026-07-01T14:55:47.430149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.19049","last_updated":"2026-05-18T19:14:52Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T19:14:52Z","title":"KVBuffer: IO-aware Serving for Linear Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T12:00:06.171816Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.19049"},"observation_digest":"sha256:a724eb0e78202c94a7d0c75a98357e142808d285f688e2fec57f2c6b07c599a6","observation_id":"9cfb3d57-dc5d-458c-b3bf-7491a8e06de5","resolution":{"observed_at":"2026-05-20T12:03:15.266238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-02T21:06:34.067413Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:6156263c692f50122ac5085a28478bf11aae2d62788f9771130181f959044676","observation_id":"9fe4a42a-9aa2-448a-a3e9-2f9a8264f3c0","resolution":{"observed_at":"2026-05-20T07:58:07.546337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.21649","last_updated":"2026-05-20T19:03:38Z","snapshot_observed_at":"2026-08-02T10:50:10.193898Z","submitted_at":"2026-05-20T19:03:38Z","title":"EntmaxKV: Support-Aware Decoding for Entmax Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:01:28.988942Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.21649"},"observation_digest":"sha256:29f27fa831201fab93a8325db58d82c54b2b3a90133cf968b389d283fa6ce48e","observation_id":"8131eb8b-a3f0-4773-a222-da8eead1d4e7","resolution":{"observed_at":"2026-05-22T09:04:45.948518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.22791","last_updated":"2026-05-21T17:44:57Z","snapshot_observed_at":"2026-08-02T18:49:18.659915Z","submitted_at":"2026-05-21T17:44:57Z","title":"Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T04:53:24.400091Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.22791"},"observation_digest":"sha256:286684b942f28511ade88b7b6880585fa6c2499770ddb544e2264d10199fda45","observation_id":"3457a483-f5a9-42bd-ad98-72e9216099a4","resolution":{"observed_at":"2026-05-22T04:54:36.599302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.23889","last_updated":"2026-05-22T17:50:48Z","snapshot_observed_at":"2026-08-03T03:54:18.940526Z","submitted_at":"2026-05-22T17:50:48Z","title":"HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-25T04:33:48.127707Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.23889"},"observation_digest":"sha256:bc2f947d7e996b78e8f6d593372d50fc069bc2f6fb239baa7039076215baebb4","observation_id":"a5364585-c31b-4f32-8630-7d9e9ba2b820","resolution":{"observed_at":"2026-05-25T04:35:20.918343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.30409","last_updated":"2026-05-28T17:59:17Z","snapshot_observed_at":"2026-08-01T22:42:27.290993Z","submitted_at":"2026-05-28T17:59:17Z","title":"SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T07:39:41.553623Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.30409"},"observation_digest":"sha256:81282cd918903820c9cf9014e229c207f8c73b9836e404f2e8eec0a6d56ebb63","observation_id":"d81d6ed5-5c7d-4098-8621-edf1d52bd63a","resolution":{"observed_at":"2026-06-29T07:43:13.644858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.31163","last_updated":"2026-05-29T11:13:00Z","snapshot_observed_at":"2026-08-01T14:41:04.597557Z","submitted_at":"2026-05-29T11:13:00Z","title":"Memory by Design: Probabilistic Sequence Layers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T21:07:31.407554Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.31163"},"observation_digest":"sha256:490ad4c3bf4a3c73164ae5b28d042b529743ad796bb7f78c7ce75ab3a85d0ff5","observation_id":"3eac1317-6324-45fb-8d4c-d9fa6af0819c","resolution":{"observed_at":"2026-07-01T20:26:12.886984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:531b2a5b4e8774cdf6471e51d66db9d67717f4a847067148c7f9e07be1dcf156","observation_id":"1f728b27-b06d-4858-b0bb-82c388acf58d","resolution":{"observed_at":"2026-07-01T19:26:00.707508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.06034","last_updated":"2026-06-04T11:29:05Z","snapshot_observed_at":"2026-08-04T02:10:51.931026Z","submitted_at":"2026-06-04T11:29:05Z","title":"When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T02:36:03.243732Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.06034"},"observation_digest":"sha256:20f4564edb0d846dfb1288f33a1b0b92383bcedb3bf0dfe4d1fdee1206fb075e","observation_id":"23b270cb-f7b0-4820-865a-39acde4c9bae","resolution":{"observed_at":"2026-06-28T02:41:31.882425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.06453","last_updated":"2026-06-04T17:48:17Z","snapshot_observed_at":"2026-07-06T23:46:15.936608Z","submitted_at":"2026-06-04T17:48:17Z","title":"Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T01:07:14.691347Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.06453"},"observation_digest":"sha256:ea79e0307e1cf53ddbd77a904c17be93794176e66e83efa82ff0109af7d4c00c","observation_id":"b2c0cd7f-ed2c-41dc-8f88-72c9eda16f27","resolution":{"observed_at":"2026-07-02T13:36:59.413041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.06467","last_updated":"2026-06-04T17:54:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T17:54:04Z","title":"You Only Index Once: Cross-Layer Sparse Attention with Shared Routing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T01:06:04.896501Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.06467"},"observation_digest":"sha256:3dde34d88bdf2a9adeed8e9c4df986b75d09a9a5b024ae56cc88d169cf580587","observation_id":"14d4d18f-62c0-451e-b82a-5aaccabedd55","resolution":{"observed_at":"2026-07-02T13:36:59.549388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.06624","last_updated":"2026-06-08T15:12:03Z","snapshot_observed_at":"2026-08-02T09:46:22.331867Z","submitted_at":"2026-06-04T18:21:03Z","title":"Principles and Practice of Deep Representation Learning: or a Mathematical Theory of Memory","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-28T03:07:52.730713Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.06624"},"observation_digest":"sha256:84b0068e49af414a34d0951f3c50f85ab8d482b5fb8f04ebb8ab4c16cec1de67","observation_id":"e13357e3-3a68-4815-8d38-a254333c20f8","resolution":{"observed_at":"2026-07-02T11:46:55.258244Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.07317","last_updated":"2026-06-08T08:58:58Z","snapshot_observed_at":"2026-08-03T01:41:20.836170Z","submitted_at":"2026-06-05T14:37:02Z","title":"Gated Bidirectional Linear Attention for Generative Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T20:38:01.086990Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.07317"},"observation_digest":"sha256:6f663ace860868fc1548f63993ed08675693b338fe46d172110174b1fb55ba27","observation_id":"156b442d-5f90-425f-9378-ec32da37f074","resolution":{"observed_at":"2026-07-02T20:17:22.261079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.09659","last_updated":"2026-06-08T15:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T15:43:16Z","title":"End-to-End Context Compression at Scale","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-27T16:36:54.699174Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.09659"},"observation_digest":"sha256:eec7f2768abcc0f69858cd140d6d6b8a2c64b46aa7ac4766e1dd7f276ce87452","observation_id":"7f2316ad-a695-45b7-996a-6ec6dca2dc96","resolution":{"observed_at":"2026-07-03T01:17:31.552992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.09862","last_updated":"2026-05-31T17:43:06Z","snapshot_observed_at":"2026-08-03T01:37:13.983372Z","submitted_at":"2026-05-31T17:43:06Z","title":"Blurry Window Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:43:34.429061Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.09862"},"observation_digest":"sha256:c414b2bef31962c9467e9525e0d31305cc6da7550f253a55ca17580a536d86fc","observation_id":"0bf84b1f-5931-462a-8a99-ba2c7ec45df0","resolution":{"observed_at":"2026-07-01T20:46:14.018167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:920461f7487d31cdc0f7fcf4ed4c981a1f9d84ad35ea3606bd5e8d3e08305cb9","observation_id":"3e276bbf-6ebc-4ead-83e0-f496a9d6499a","resolution":{"observed_at":"2026-07-03T10:48:03.158827Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.12364","last_updated":"2026-06-10T17:33:55Z","snapshot_observed_at":"2026-08-02T21:20:30.250234Z","submitted_at":"2026-06-10T17:33:55Z","title":"On Subquadratic Architectures: From Applications to Principles","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T10:27:34.213676Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.12364"},"observation_digest":"sha256:8c00b1db046c555af131a93a644008b038ea53de8ba86793ec28e0ddeccf0f9e","observation_id":"1c535d7f-e6a3-4aed-9d67-a1712083fb23","resolution":{"observed_at":"2026-06-27T10:30:51.596621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.27229","last_updated":"2026-07-06T18:45:56Z","snapshot_observed_at":"2026-08-02T17:52:23.003401Z","submitted_at":"2026-06-25T16:16:51Z","title":"CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T04:26:00.066003Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.27229"},"observation_digest":"sha256:822ef06e162c7dd94d7aea4ba640c64ca90ff796a9b8c64fb2e743d29e12620f","observation_id":"9413d482-399b-42ab-9b45-5f4c896c5c29","resolution":{"observed_at":"2026-07-04T14:09:53.423055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.27229","last_updated":"2026-07-06T18:45:56Z","snapshot_observed_at":"2026-08-02T17:52:23.003401Z","submitted_at":"2026-06-25T16:16:51Z","title":"CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T09:42:52.096671Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.27229"},"observation_digest":"sha256:a3a3dbaf3bd9dda77ad391ef5d0463c9634671a9f2dd54eeed99abaeb36a927e","observation_id":"9ae232e7-76ac-4164-9581-5afdf26ceaf0","resolution":{"observed_at":"2026-06-30T09:44:37.439663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-12T11:49:31.618283Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27229","last_updated":"2026-07-06T18:45:56Z","snapshot_observed_at":"2026-08-02T17:52:23.003401Z","submitted_at":"2026-06-25T16:16:51Z","title":"CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T11:49:31.618283Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.27229"},"observation_digest":"sha256:2991a47e22d79a2e4febd637c44fe36e54273eb8e36f8f6e09b54f6954c4f4aa","observation_id":"cdf5ff6a-d52e-47a5-ade3-dd4a0d2711c7","resolution":{"observed_at":"2026-07-12T11:49:31.618283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:57.030469Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:b7f6eb11043572af73b719860fc62d7c70d4f85815f91006399d2f76d42ec037","observation_id":"a6805378-502e-440b-bfc4-d5429812d0fa","resolution":{"observed_at":"2026-06-30T09:54:35.307609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-13T07:16:45.194991Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture.https: //arxiv.org/abs/2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T07:16:45.194991Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:f0d37b580ad8dc38f8a30ddbc5be83ca700a7fd744139026d9892de4352e84ab","observation_id":"8c7bc288-168b-40c1-aa95-35ec9b136aad","resolution":{"observed_at":"2026-07-13T07:16:45.194991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.29904","last_updated":"2026-06-29T07:40:58Z","snapshot_observed_at":"2026-08-02T14:16:07.347195Z","submitted_at":"2026-06-29T07:40:58Z","title":"Timesteps of Mamba Align with Human Reading Times","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-30T06:49:07.298160Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.29904"},"observation_digest":"sha256:128142870381b1bd948bb97310e43c50d8f652c5828ba59a857f244356c762fa","observation_id":"e9c4921b-d4b3-4170-9c5b-84096877ab69","resolution":{"observed_at":"2026-06-30T06:54:20.515930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:64f11fa05337475583ea429b3f349a66d7c103a51932bfd51d051e63cf6f8bdf","observation_id":"3b8599c0-e6fb-4d1b-9c1e-94ba99e40b3b","resolution":{"observed_at":"2026-06-30T08:44:28.058764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2607.01299","last_updated":"2026-07-12T15:14:05Z","snapshot_observed_at":"2026-08-05T00:07:56.394047Z","submitted_at":"2026-07-01T14:03:56Z","title":"HYPIC: Accelerating Hybrid-Attention LLM Serving with Position-Independent Caching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T18:53:12.126023Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.01299"},"observation_digest":"sha256:d908ca52312945283471fb2b5339403f3e9b020db45abd872e26c46d5e36a14c","observation_id":"d7719444-cfa5-4438-8ade-213476af67cb","resolution":{"observed_at":"2026-07-03T18:58:50.728456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-14T16:49:27.301911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01299","last_updated":"2026-07-12T15:14:05Z","snapshot_observed_at":"2026-08-05T00:07:56.394047Z","submitted_at":"2026-07-01T14:03:56Z","title":"HYPIC: Accelerating Hybrid-Attention LLM Serving with Position-Independent Caching","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T16:49:27.301911Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.01299"},"observation_digest":"sha256:ab123cac358b2bc55964babfed94991c3def770a69d81d04ce23dccec6fede0b","observation_id":"2f90d8db-4490-4bb7-9888-6e93d334bb60","resolution":{"observed_at":"2026-07-14T16:49:27.301911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2607.02073","last_updated":"2026-07-02T12:11:49Z","snapshot_observed_at":"2026-08-01T01:57:32.190005Z","submitted_at":"2026-07-02T12:11:49Z","title":"Evidence-State Rewards for Long-Context Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-03T13:25:14.844589Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.02073"},"observation_digest":"sha256:e1996a42716a9bdf3f33b7ce93f17493b5cc6cee1c32ea347543c4f428f12642","observation_id":"a9428ec2-acc6-48c0-8c06-c2c89d3b19fb","resolution":{"observed_at":"2026-07-03T13:28:18.204607Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-12T05:11:52.395478Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03055","last_updated":"2026-07-03T07:44:44Z","snapshot_observed_at":"2026-08-04T16:02:09.054749Z","submitted_at":"2026-07-03T07:44:44Z","title":"SHiPPO: Recurrent Memory with Transported Polynomial Projections","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T05:11:52.395478Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.03055"},"observation_digest":"sha256:4324aebbf1fa809dcbb17d9eca0bf1155bffc2fa2f3bdd70727aa9cb5b980502","observation_id":"e03c1908-7587-4fbe-ba75-4b9a4d46c8ca","resolution":{"observed_at":"2026-07-12T05:11:52.395478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-02T09:36:26.285984Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:abf82734009a4a4b6e2e8e62d3b3e4f97142a2deea42e8ecbe0cf769d58cae31","observation_id":"c2eb8bcd-5ac9-4afe-8186-fee909aa5f6e","resolution":{"observed_at":"2026-07-09T01:45:50.809547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-02T14:25:03.529897Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:c97ab87cb5e7ae670d2d992dbe4bfc518027c7ea54fe8e935d21c65713f168f9","observation_id":"bc7af603-b610-4bab-b73c-5877701bfd55","resolution":{"observed_at":"2026-07-10T14:57:14.483248Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Kimi linear: An expressive, efficient atten- tion architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-07-15T23:18:00.618125Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:3d5625065bd2648c756c3a37a5d6fd0f489c0fa917443df2699db36d4dac1fe3","observation_id":"67b185ac-4f92-45ff-9857-6e3e85f7ef35","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-02T06:39:22.418349Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-05T01:10:26.292707Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:39:22.418349Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:6e3195222be7dc6690dac71a50ea9d2d7b2e21af0e420aa2b7239d170e1cbeb3","observation_id":"4cf222d0-c388-486a-a352-10976826336b","resolution":{"observed_at":"2026-08-02T06:39:22.418349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-03T02:03:24.541627Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-05T01:10:26.292707Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:24.541627Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:512fb3053f45787c6b1694a249047270d9193b1bfc11b821e9330d8c3522e103","observation_id":"def46d64-c570-43ff-9648-1dea801a2e65","resolution":{"observed_at":"2026-08-03T02:03:24.541627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T19:49:13.762529Z","title":"Kimi Linear: An expressive, efficient attention architecture","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16848","last_updated":"2026-07-18T15:09:58Z","snapshot_observed_at":"2026-08-03T22:53:27.118985Z","submitted_at":"2026-07-18T15:09:58Z","title":"Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:13.762529Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.16848"},"observation_digest":"sha256:261dad4138e4e71e6ddcc702e7be9917789ca6a8a4001b0533e9f13001a973d6","observation_id":"f1f013e8-402b-4073-bf80-5e11e636ebd8","resolution":{"observed_at":"2026-08-01T19:49:13.762529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-02T09:17:47.299700Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19378","last_updated":"2026-07-30T22:07:23Z","snapshot_observed_at":"2026-08-05T01:10:27.610671Z","submitted_at":"2026-07-01T02:39:18Z","title":"Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:47.299700Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.19378"},"observation_digest":"sha256:b1712ebbb4022d198bd15e0362375d92e2592e806108e06cbbd6e18d58d53172","observation_id":"fb3387b6-c813-4594-b2b7-01f201f96f88","resolution":{"observed_at":"2026-08-02T09:17:47.299700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-03T02:08:20.290764Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19378","last_updated":"2026-07-30T22:07:23Z","snapshot_observed_at":"2026-08-05T01:10:27.610671Z","submitted_at":"2026-07-01T02:39:18Z","title":"Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T02:08:20.290764Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.19378"},"observation_digest":"sha256:a953de06c57bedb9e9736538a32e43488b101c91fec37156ae1fb66f6be508fd","observation_id":"432cb132-374e-4e15-b6a4-79b5b8590cae","resolution":{"observed_at":"2026-08-03T02:08:20.290764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T08:57:43.970524Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20970","last_updated":"2026-07-23T06:46:58Z","snapshot_observed_at":"2026-08-04T04:44:44.704608Z","submitted_at":"2026-07-23T06:46:58Z","title":"From Scalars to Time Series: Rethinking Implicit Neural Representations for Time-Varying Volumetric Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:43.970524Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.20970"},"observation_digest":"sha256:2b700bf5cb41eecef182519b9436d650590a7db7be833d5b0a609e172270c42b","observation_id":"6dd4bf36-fe90-46fd-a305-59ffa98fa70e","resolution":{"observed_at":"2026-08-01T08:57:43.970524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T07:09:05.662964Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T22:42:28.999422Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.662964Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:f3670b1e954f1ae3ef95310d720d990d9488b6103385691771a7efa99e58b370","observation_id":"d3fed15d-513b-4eb8-acb4-9120230e8599","resolution":{"observed_at":"2026-08-01T07:09:05.662964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T02:44:01.780935Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-01T20:09:34.932018Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.780935Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:0a5a46af9f0633689c8299770147a2d9b414bd5487fd9e55565106b6c0926cc8","observation_id":"9ab79ce3-e90f-454b-96df-5f08e5183d8d","resolution":{"observed_at":"2026-08-01T02:44:01.780935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T02:37:54.231897Z","title":"Kimi linear: An expressive, efficient attention architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-01T14:23:07.610419Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.231897Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:4dd5a0b431ef9ae30ae1e75d4a5cc3291d86123c1f29610da5f534ff41df2e3f","observation_id":"73ef5fbe-a39a-49f4-93d1-58c426563884","resolution":{"observed_at":"2026-08-01T02:37:54.231897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T06:08:27.930847Z","title":"arXiv preprint arXiv:2510.26692 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27539","last_updated":"2026-07-30T00:17:05Z","snapshot_observed_at":"2026-08-04T19:50:12.932362Z","submitted_at":"2026-07-30T00:17:05Z","title":"Subtract or Replay? Exact Deletion from Language-Model Memory","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T06:08:27.930847Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.27539"},"observation_digest":"sha256:d28019ed34ea0b4f124d34dfede39d118511cc1165dd268f83de7b86f6bfcbfc","observation_id":"8a0057b2-c7fc-4d64-9f00-23ae7b625bfa","resolution":{"observed_at":"2026-08-01T06:08:27.930847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-31T02:16:08.200768Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-03T00:12:46.043696Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.200768Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:a8c30a5ea8fb4bc75ffb3918e25bc0fbf12bf82bd20397230d4a8208cddce217","observation_id":"cee43a81-79fd-4491-bbc7-17946f0ff2af","resolution":{"observed_at":"2026-07-31T02:16:08.200768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-04T23:34:56.804544Z","title":"Kimi linear: An expressive, efficient attention architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-05T01:25:34.689589Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.804544Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:f02066eaef8211ec9d99a3a24ad2da73d3f841b242b1cd591c5e9c9aa45c9ae9","observation_id":"2a5a3837-1995-4e42-b918-6191772cb2a2","resolution":{"observed_at":"2026-08-04T23:34:56.804544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-04T23:14:10.779384Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-05T01:25:36.331179Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.779384Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:11cc26ca6111ca8047163abebeaedeebdf2ebb441029f0d19ae928b9f132b8ba","observation_id":"21e81452-944f-4526-99ff-b77dd6ce18f2","resolution":{"observed_at":"2026-08-04T23:14:10.779384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-04T05:46:28.137780Z","title":"arXiv preprint arXiv:2510.26692 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02515","last_updated":"2026-08-03T17:12:05Z","snapshot_observed_at":"2026-08-05T01:32:17.238042Z","submitted_at":"2026-08-03T17:12:05Z","title":"LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T05:46:28.137780Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.02515"},"observation_digest":"sha256:cd22f185cd39fb5a734596b0d7d71ee34134fff518284fa8e100a82f7a3c31cc","observation_id":"b4d13edd-e7a3-4f69-9bd6-f04eb7f08839","resolution":{"observed_at":"2026-08-04T05:46:28.137780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.26692/citation-record","integrity":"/paper/2510.26692/integrity","json":"/paper/2510.26692/citation-record.json","paper":"/paper/2510.26692"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:16cf0cbfc0b7936c5dbe4aed44e89e7ef9dd654f1cf1a07c9190aafb13c25f92","observation_id":"75a27a1d-a0e5-4c0a-8d8f-60cfd9baf605","resolution":{"observed_at":"2026-05-13T23:49:10.690152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09752","last_updated":"2023-10-24T00:51:49Z","snapshot_observed_at":"2026-07-06T15:04:31.778399Z","submitted_at":"2023-03-17T03:28:17Z","title":"CoLT5: Faster Long-Range Transformers with Conditional Computation","version":3},"cited_work":{"arxiv_id":"2303.09752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.09752","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ainslie, T","venue":null,"work_id":"ffe0489f-b4bb-4f0a-a69a-f7e79c161dd0","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2303.09752","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:c04e323b14bc5c2c336fd71b727a1fb4377220e492a1433bea1fb2eac5a884f7","observation_id":"f2d765b8-51d0-48cd-a621-a28bd003202a","resolution":{"observed_at":"2026-05-13T23:49:10.697142Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2139/ssrn.5240330.doi:10.2139/ssrn.5240330","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","venue":null,"work_id":"4c8a21d6-4ecc-40b1-b707-2e5d9d1b063a","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:036d7ebb71c3226856de53e9f3afb2ac4afb9a8130cd8b0ca4189819dad4d7bc","observation_id":"cc70616c-5253-48ff-8a81-228a14e420d9","resolution":{"observed_at":"2026-05-13T23:49:10.655674Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":"f4cb9331-2572-41e4-8db1-75c0cf2eaf98","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:d914a57ada3adcc5c39ea69e54789f47e3df84b71105766722c84e0f4c6d5f79","observation_id":"5d1858b2-c388-4cfa-830b-efa7740dcf43","resolution":{"observed_at":"2026-05-13T23:49:11.437770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2312.04927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-07-03T13:48:20.285344Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"a51e0ddf-22e2-4d3c-9759-7201f7d9a699","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:73e4af6813fa8c55fd6c371e98841429b52705efe5b4527106b5fe12c047f297","observation_id":"2ddd84e6-3e43-4f36-a05c-f83b5bde0427","resolution":{"observed_at":"2026-05-13T23:49:10.704970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15204","last_updated":"2025-01-03T11:44:51Z","snapshot_observed_at":"2026-08-04T21:07:04.238345Z","submitted_at":"2024-12-19T18:59:17Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","version":2},"cited_work":{"arxiv_id":"2412.15204","doi":"10.48550/arxiv.2412.15204","metadata_source":"pith","pith_arxiv_id":"2412.15204","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","venue":"cs.CL","work_id":"9fac250b-241e-41ce-9177-469deaf03040","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2412.15204","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:b0e771d66693a4e6bb86e6443674cabbe9fe60ab01df589f7f52c18bd8f4424c","observation_id":"636a967b-4c93-4789-a3fc-863072673810","resolution":{"observed_at":"2026-05-16T20:38:00.425257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","venue":null,"work_id":"8401820b-a3f9-43a1-8fb3-9d44d8baea2b","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:e8c7a633fa459950d2df720fc1ef4154101f6b9ef589f95eea19429345cadc4b","observation_id":"4dfe037c-6222-4d49-aa87-1d2c90222dfa","resolution":{"observed_at":"2026-05-13T23:49:11.335981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:1b27a7a18354b5fb9324a4544c14caa08d097cc4d7c782545abe5cf5517ab99d","observation_id":"0a88c6d3-38f2-435a-81e3-042c953e7f23","resolution":{"observed_at":"2026-05-13T23:49:10.676753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlimiformer: Long-range transformers with unlimited length input","venue":null,"work_id":"420ae22a-54ac-4f01-a2e8-e8b2b98e1321","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:84df9b29b405bd0b7e6d34f19e8343617ba46980f35c5e816efd13e55c4ab3ec","observation_id":"2717f60e-5f6c-49f3-b72f-aa29a46d53e9","resolution":{"observed_at":"2026-05-13T23:49:11.267868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-02T05:44:43.939336Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":"2405.14782","doi":"10.48550/arxiv.2405.14782","metadata_source":"pith","pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","venue":"cs.CL","work_id":"47b597a2-a355-4305-b1e4-80666b394ccd","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:7f725f3ac2316d0ef6826e71f18952c64690af9b9e65554c4648b3fc147cf8f4","observation_id":"ded99052-3d15-4837-bd9d-9b946ac9685d","resolution":{"observed_at":"2026-05-16T18:44:50.211576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The WY Representation for Products of Householder Matrices","venue":null,"work_id":"665e2e9a-2726-4d38-a70b-80b56a7221dc","year":1987},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:352b25ac81079af76b7a65270d3612cbbec9401ab87e0fee2d34f7747dc8bfe9","observation_id":"acfb3d28-48e5-4f49-ac96-bd31f034edd1","resolution":{"observed_at":"2026-05-13T23:49:11.247558Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-04T18:37:12.098336Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":"2504.03624","doi":"10.48550/arxiv.2504.03624","metadata_source":"pith","pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Nemotron-H: A family of accurate and efficient hybrid Mamba-Transformer models","venue":"cs.CL","work_id":"134d0eac-bc97-4065-9c60-e8fde9d20b48","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:d10d2bb8ae6777ed8727f958680d7c5c93d6f551446be6f688685a48135660e7","observation_id":"17536ca1-0ea1-4476-ae2f-a8009bac0b87","resolution":{"observed_at":"2026-05-13T23:49:10.991207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11612","last_updated":"2024-06-17T14:58:29Z","snapshot_observed_at":"2026-07-06T18:32:15.404516Z","submitted_at":"2024-06-17T14:58:29Z","title":"Long Code Arena: a Set of Benchmarks for Long-Context Code Models","version":1},"cited_work":{"arxiv_id":"2406.11612","doi":"10.48550/arxiv.2406.11612","metadata_source":"pith","pith_arxiv_id":"2406.11612","snapshot_observed_at":"2026-07-10T10:07:00.782049Z","title":"Long Code Arena: a Set of Benchmarks for Long-Context Code Models","venue":"cs.LG","work_id":"c76eb3cf-0c05-4fa4-80de-2b0ef53280e2","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2406.11612","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:000d0660a235bad49da3f6f0e40b5f9ab9083d6239474a74de1c6b6c4ce3ac35","observation_id":"5881d725-3ebe-43e6-88bf-6fa63390aced","resolution":{"observed_at":"2026-05-13T23:49:10.998413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:6b621da4d6dbd48fc200819396654d14ee5f13cc27cc9587d111f4d86e6489eb","observation_id":"d02947d1-91e6-43d1-ae15-88cb8b793b05","resolution":{"observed_at":"2026-05-13T23:49:11.003486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-07-10T21:57:38.198014Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:d4706a85667b993c4def10bf4ea024121ec0dada71e885323c718d9ac94a4a86","observation_id":"c5da126a-83fa-493a-b4b9-4efedce0b6df","resolution":{"observed_at":"2026-05-13T23:49:11.008835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-10T21:57:38.573725Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:547294550379bf1431fad4b3e8c42fbc9e829d579ceaa8677aed77a4d4235e25","observation_id":"679ced53-34f0-4da6-bb84-d5b744f83fb7","resolution":{"observed_at":"2026-05-13T23:49:10.661609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":null,"work_id":"8ffc7bc2-ebcf-4182-8ea8-1e14c6b8abd5","year":2022},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:186377122d36ab59b11aecf92b6d2e0966886f9b673ad692b93b224cc84eb54b","observation_id":"376c4780-c4d2-4c3a-9b57-17258484afa4","resolution":{"observed_at":"2026-05-13T23:49:11.272231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"057e67ab-e32a-4f3b-8278-48abdf215d09","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:6afb51ab09e1c867791b2921101a4eddff99ff877ea9dd74786d833dc49b90cc","observation_id":"29562b0a-dbf4-45fb-b00f-47df45236b92","resolution":{"observed_at":"2026-05-13T23:49:11.275804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:c67ee5fc9b0f71941d9c6b8740007ffd42a3e9a37df8dbbbd8a8daf5ef66d89a","observation_id":"75b71539-d593-4791-b654-56dac58c0a93","resolution":{"observed_at":"2026-05-13T23:49:11.013613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-07-06T15:50:41.385379Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":null,"work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:7b8ba03f1ea7b09a7171d20d04a8f8ce0ae4c8711a591d68fb078deb98c17d84","observation_id":"c40f6a54-1ad0-431c-b955-beb850f50ded","resolution":{"observed_at":"2026-05-13T23:49:11.019394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"cited_work":{"arxiv_id":"2412.05496","doi":"10.48550/arxiv.2412.05496","metadata_source":"pith","pith_arxiv_id":"2412.05496","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","venue":"cs.LG","work_id":"692b9d44-343b-4635-a0dc-1ee8fe539aa3","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2412.05496","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:26f19f12e3650c73f64a90cb9ccc5e6b2f01b325a56746cfdb29a06933c0b575","observation_id":"7e58ddc8-49b7-4210-99fb-3d42baf23d55","resolution":{"observed_at":"2026-05-17T21:27:16.810492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T05:54:39.898364+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T05:54:39.898364+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-02T12:55:25.835610Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-07-11T00:17:46.055816Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:6384f8457a816ede54d1a7c2ba8c39b54ab957969a338e37680fdc31652ee5a1","observation_id":"2877e21b-05ea-4b5d-99a9-8fb659bc4e14","resolution":{"observed_at":"2026-05-13T23:49:11.040289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:26:12.834355Z","title":"Jacob Dunefsky, Philippe Chlenski, and Neel Nanda","venue":null,"work_id":"d7938f40-a443-4bee-b8b8-25a766644446","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:5f912fca74245ba70498a0318c30f6d6e81a62685824c9fb41c92058a8bae7ec","observation_id":"a8ff28fd-ee9b-4060-a851-90f199868b08","resolution":{"observed_at":"2026-05-13T23:49:11.066499Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07019","last_updated":"2026-04-15T13:24:10Z","snapshot_observed_at":"2026-07-06T22:32:03.314860Z","submitted_at":"2025-10-08T13:44:57Z","title":"Native Hybrid Attention for Efficient Sequence Modeling","version":3},"cited_work":{"arxiv_id":"2510.07019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.07019","snapshot_observed_at":"2026-07-03T13:48:20.314999Z","title":"Native Hybrid Attention for Efficient Sequence Modeling","venue":"cs.CL","work_id":"f0ff0e30-d471-4d57-a0cd-7de4b22fd03a","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2510.07019","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:8b9254b6caf32d40896b51278dd3d14da98fb77e4068281c13e088a3285bd079","observation_id":"14ffcf2d-481a-441f-8541-849cc8083d27","resolution":{"observed_at":"2026-05-13T23:49:11.073560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.14909","doi":"10.48550/arxiv.2406.14909","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Moa: Mixture of sparse attention for automatic large language model compression.arXiv preprint arXiv:2406.14909","venue":null,"work_id":"adb4db82-49c4-43ed-bd1e-898fc0a4e7c1","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:264948a99e5a1f5265c271196df7aa9cfeb7e722b29cae3280a7145931b37738","observation_id":"4eab9d81-4c41-42d1-bbb6-c14914f23626","resolution":{"observed_at":"2026-05-13T23:49:11.083590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-02T00:54:17.243656Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":"2406.04127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-07-04T19:20:05.653512Z","title":"Are we done with mmlu? CoRR, abs/2406.04127","venue":null,"work_id":"ed71a0fb-b1cc-4fbc-a1d5-01a096a4e957","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:46cb9b48d76ae1f1bee800c4986a745fc8cc28c7f2e612ad720a4ba224eae4e9","observation_id":"ed9b015b-6b73-4953-b781-6081c3887c81","resolution":{"observed_at":"2026-05-13T23:49:11.089956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues","venue":null,"work_id":"6f9819ff-fed4-41ff-a67e-221b8270a322","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:1e2ba0cf5282e8e7858516cff21d90d1d8608c72ef385146fcadc9e2870606bb","observation_id":"e2f45a81-9831-4efe-9fca-4ac25e8fd3f7","resolution":{"observed_at":"2026-05-13T23:49:11.331895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.hm.2010.06.003","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How ordinary elimination became Gaussian elimination","venue":null,"work_id":"66e1da51-b9d6-43e6-97fd-8164f7cfacb2","year":2011},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:efcbf9335240b538f8fe685abfb4383edeb3e8323962a7a81e88efce4da765fc","observation_id":"8c9cb472-c460-496f-9e04-0630f0a582ec","resolution":{"observed_at":"2026-05-13T23:49:10.650817Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-10T20:07:33.480124Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:9b79053a9a204da02853261990f4506e650ed313253a53254d8b1e98abf928ef","observation_id":"eb8bed08-9d2f-4796-952b-f217bf44ba12","resolution":{"observed_at":"2026-05-13T23:49:11.095862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"24115d62-bb15-4b86-9e79-af4b786af725","year":null},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:c170b340740545480b137bcd53da4efd0d0c47ce65418f011dfaeb8f3a079e28","observation_id":"d08418ee-58b2-4036-93ce-ba1bea843c40","resolution":{"observed_at":"2026-05-13T23:49:11.362813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":"2111.00396","doi":"10.48550/arxiv.2111.00396","metadata_source":"pith","pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","venue":"cs.LG","work_id":"4150b761-b8bf-4d9b-a2f8-cb2d1b73d378","year":2021},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:95caf7d8c495830c1a284dc4a84b40e1d4fcf7da3d3321a4e1b1cbd61473f839","observation_id":"948722bc-294c-4f53-af35-4dc9204c0ea6","resolution":{"observed_at":"2026-05-13T23:49:11.101786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":"2410.10781","doi":"10.48550/arxiv.2410.10781","metadata_source":"pith","pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","venue":"cs.CL","work_id":"ab480e70-3517-4875-81ef-6cc6fa6db46d","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:32ea6198b34920404c36dcf7edeb5308def52648b1bd381500c59ccad2b4b89a","observation_id":"8ac8f492-1d49-43d1-917b-195797da74e1","resolution":{"observed_at":"2026-05-16T17:41:03.919229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.15884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:33.450397Z","title":"Jet-nemotron: Efficient language model with post neural architecture search","venue":null,"work_id":"ce920786-ab4a-4858-a933-0637bfc7b2f9","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:79ee851037a81453a85e0faff6f5756a94549bf5aed2c43c10f77593f14766c3","observation_id":"84818da9-debf-410e-a5bb-f20cdf2b403e","resolution":{"observed_at":"2026-05-13T23:49:11.111878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning","venue":null,"work_id":"5faf7f43-6b4c-4dda-87e6-18b7076a7371","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:d48fa0239d3237be763a4af2bc5e8fdd9aa1a21de5261f83f85003413b22dae4","observation_id":"05e17856-bb91-43a2-9378-96d8571aa527","resolution":{"observed_at":"2026-05-13T23:49:11.379086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.804512Z","title":"Log-linear attention","venue":null,"work_id":"9c67d35a-c055-4f41-862f-308bd2e3e832","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:581f4164a59c7da2b4cc14bf81a6dc3b502578f485bce4be167f5eb9a1e8e9d8","observation_id":"eb9b74d4-1501-49d9-9d20-2c8883a80055","resolution":{"observed_at":"2026-05-13T23:49:11.120285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09113","last_updated":"2022-04-24T08:56:39Z","snapshot_observed_at":"2026-08-04T17:48:12.200183Z","submitted_at":"2019-02-25T07:07:38Z","title":"Star-Transformer","version":3},"cited_work":{"arxiv_id":"1902.09113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.09113","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Star-transformer","venue":null,"work_id":"85d2d792-5ce6-491c-af1b-40f2d6b30669","year":1902},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/1902.09113","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:788b4ffed6e396c3845a1ecbcf90bd6224664bc84dd851cad11f4121dd8e0347","observation_id":"ed4b7bb6-583d-4e6d-8d38-8bab179db898","resolution":{"observed_at":"2026-05-13T23:49:11.126833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:6690c2b834fb0d57a7d9cf2a5a323bdde4ef1d42903f35cd1c163f7191e1f938","observation_id":"0e2fe11a-7e44-4f1a-b85f-67d5ffdca829","resolution":{"observed_at":"2026-05-13T23:49:11.133460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:2c67020ed7a1c93e327f3812e1369f8e23ad5a9e2de5a2c1cb3dd36f0d9e9eb4","observation_id":"b90d53ba-c434-43a9-ac51-62f0a70ee9d5","resolution":{"observed_at":"2026-05-13T23:49:11.138710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-07-10T20:07:33.531106Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:99986c55021cf7ea01236eb5ce51f285e024e1eb0191aea8a63c8946d04fd177","observation_id":"34e7ecfc-c416-4ea7-8b3f-9ba281284098","resolution":{"observed_at":"2026-05-13T23:49:11.144494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attractor memory for long-term time series forecasting: A chaos perspective","venue":null,"work_id":"e4e05f50-9cc3-424c-b481-7827b10040d3","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:7110e07c1fe1c26e5f462661fb16b868aa3411b574b4d67ed29a65437355abf4","observation_id":"e34218d9-33eb-480f-8fd9-d3226c42f60d","resolution":{"observed_at":"2026-05-13T23:49:11.410394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.02475","doi":"10.48550/arxiv.2506.02475","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Thomas Jiralerspong and Trenton Bricken","venue":null,"work_id":"a738296f-0c2f-43cc-bb34-78e24cdb91c9","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:ef9a70995a055149c7a838090663362aad18836a08ad46314969d238f92de8f6","observation_id":"047ee04a-b254-41b2-a058-aa7b20cab988","resolution":{"observed_at":"2026-05-13T23:49:11.150313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17739","last_updated":"2025-07-14T04:23:36Z","snapshot_observed_at":"2026-08-04T11:01:04.622331Z","submitted_at":"2024-12-23T17:44:01Z","title":"Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization","version":4},"cited_work":{"arxiv_id":"2412.17739","doi":"10.48550/arxiv.2412.17739","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17739","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Fourier position embedding: Enhancing attention’s periodic extension for length generalization","venue":null,"work_id":"9793f2ed-d21a-44bf-931e-e6a815a7c54b","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2412.17739","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:6b77aa21de46cf731a63fcf120bbd2b89091eea942181435d34da545e9d7ffe3","observation_id":"1954f43f-480a-4efb-ba53-c9008c540c5a","resolution":{"observed_at":"2026-05-13T23:49:11.154378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer Quality in Linear Time","venue":null,"work_id":"e4779a92-13b5-4efa-892b-b19083ca082a","year":2022},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:50f47ef8626a2f16353c6048be7c61afe109f7aa9b0501cc82cf92a3bb2bbe06","observation_id":"e7e53e90-78b1-431e-9d69-755916779dfd","resolution":{"observed_at":"2026-05-13T23:49:11.422283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"d47ddcd0-0001-45a2-a510-7e01f98056d3","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:13d0ac1006ab48fc13d5954c96fce4b0241ef96e7e982873cdb6c4abb4cbbd20","observation_id":"59103331-d6ed-4ffa-9dc3-c9378bdf9eef","resolution":{"observed_at":"2026-05-13T23:49:11.426283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:ee809ec686e74ac371569dcdaa4ee3215d95f3db422187623d6bc658d8fc7c8b","observation_id":"68561cd7-b80b-4212-972c-1f0c39b714a3","resolution":{"observed_at":"2026-05-13T23:49:11.158394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-04T04:11:02.074594Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:a5f56749ef5985460ba8d63a8b76233c1c2e5f70cc109540dceb6b39d14446da","observation_id":"f3f7ac2c-eccf-44b4-984b-62f8888dbd4a","resolution":{"observed_at":"2026-05-13T23:49:11.163140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1885.114188","doi":"10.1145/1141885.1141886","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Accumulating Householder transformations, revisited","venue":null,"work_id":"de5e4599-5472-4869-99e0-84a708e37ad4","year":2006},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:b4c1393af1f46eeb6b6c103a73597f7574f4536681f694512db3cb3da9f14d84","observation_id":"81013637-b007-403d-aaca-b00036e19c08","resolution":{"observed_at":"2026-05-13T23:49:10.669304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:1d6073c91fbe6061f7b3d68711aebcd29a711f7b0f4419bfec8ea217eb2e03a8","observation_id":"3983a4af-1161-4ea9-8e75-a971fa53e833","resolution":{"observed_at":"2026-05-13T23:49:11.168258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Atten- tion","venue":null,"work_id":"24bcb503-6520-4bba-866d-2fda75af82d8","year":2020},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:b5f9b26996cc8ac5a9d3f8cfdc01b53e84701920696e094079a821ab909b604e","observation_id":"35c11660-bed0-4b52-81df-d6d0d621f45f","resolution":{"observed_at":"2026-05-13T23:49:11.446228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":"f3f18ca6-4d9c-43ba-974f-1b514a7fe5ea","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:cde52e416c7f44006641f6dc3baf6418c42ebb95ddcdeec074b391982738c8df","observation_id":"c521ae1d-8a1a-4493-a0a5-8d9449e64c12","resolution":{"observed_at":"2026-05-13T23:49:11.449849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:3a4d807eb9009e4af57dcc9ff417e3b84093c452ac5572ec9dad8401b4fe8835","observation_id":"faeaa538-5459-4389-9b05-cb3338ffc3ff","resolution":{"observed_at":"2026-05-13T23:49:11.174664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-07-11T01:27:45.922878Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:f6311adfec45c95119de6cb0f467deee9ca53b8562a3ba5cf14691cd53a3ad45","observation_id":"b2461766-1f12-4100-b088-17f01c4a9472","resolution":{"observed_at":"2026-05-13T23:49:11.179622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12941","last_updated":"2025-01-24T19:23:15Z","snapshot_observed_at":"2026-08-05T01:31:35.222989Z","submitted_at":"2024-09-19T17:52:07Z","title":"Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":"2409.12941","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12941","snapshot_observed_at":"2026-07-03T05:57:41.611759Z","title":"Fact, fetch, and reason: A unified evaluation of retrieval-augmented generation","venue":null,"work_id":"4290e6fd-208d-4ebf-9b27-60cef2eb6f04","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2409.12941","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:78048caac7f0e1a4ef1676d2f3e75a3b04bddc484d0c323388aedeba60b537b6","observation_id":"a6e6f308-c48e-4923-8db8-e70cfcc702be","resolution":{"observed_at":"2026-05-13T23:49:11.184162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Survey of Post-Training Scaling in Large Language Models","venue":null,"work_id":"c685e1c7-3c4e-49da-b3a1-fde06201ac30","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:8ed5ce00ae0ea468815e966ce09dc8fab13b7abb7cb859c98a6ce28b593c5323","observation_id":"f62f61dc-fe95-4e78-89a6-67d73daa04b5","resolution":{"observed_at":"2026-05-13T23:49:11.263226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01496","last_updated":"2025-05-07T07:42:11Z","snapshot_observed_at":"2026-07-06T20:45:41.540398Z","submitted_at":"2025-03-03T13:08:00Z","title":"Liger: Linearizing Large Language Models to Gated Recurrent Structures","version":2},"cited_work":{"arxiv_id":"2503.01496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01496","snapshot_observed_at":"2026-07-09T01:45:50.818008Z","title":"Liger: Linearizing large language models to gated recurrent structures.arXiv preprint arXiv:2503.01496","venue":"cs.CL","work_id":"55622c06-d5cf-48ff-8c05-e3aed5f2a0d4","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2503.01496","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:4679495abd7bf118801192804153bf8d52f5b4b3f20c4507004f7620f3a86b61","observation_id":"41f191aa-887b-4a77-a4c0-0843758cf62a","resolution":{"observed_at":"2026-05-13T23:49:11.189920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","venue":null,"work_id":"cae29c8d-40b0-437e-82fc-d63120cfde46","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:ec84d1e3b4c167774582e569aa306b8a14e5a1ef24253823cb417d3c7f9ec23b","observation_id":"8a1e6dc6-6aab-41c5-a027-3b284471c40a","resolution":{"observed_at":"2026-05-13T23:49:11.292125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.24067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transmamba: Flexibly switching between transformer and mamba.arXiv preprint arXiv:2503.24067, 2025b","venue":null,"work_id":"a089a52d-2061-4114-819b-c750a2effb30","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:ceeff0184ea7164224148ed717feb167ae46517d282c24697745fc411eb8308a","observation_id":"4e0ce683-6424-4b9f-a2fb-34bf4320199e","resolution":{"observed_at":"2026-05-13T23:49:11.195212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c60407b1-3a6a-41fb-be4a-71ebbfebdd07","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:7251de551d05fac4f3d02e313ceb565f419071057dbcdcfb5c856427a6e60ac3","observation_id":"20d4351b-17cc-48ec-9a5c-5248a811f133","resolution":{"observed_at":"2026-05-13T23:49:11.305237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02130","last_updated":"2025-03-31T19:41:52Z","snapshot_observed_at":"2026-08-04T16:20:45.825237Z","submitted_at":"2025-03-03T23:35:23Z","title":"Forgetting Transformer: Softmax Attention with a Forget Gate","version":2},"cited_work":{"arxiv_id":"2503.02130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.02130","snapshot_observed_at":"2026-07-04T03:29:30.170846Z","title":"Forgetting transformer: Softmax attention with a forget gate","venue":null,"work_id":"cc5197b5-1a1c-48c6-a2b9-498e8ac867ce","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2503.02130","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:435698ea818f8a4e7e15964751d47354f051bc5f67f1c6b948a6e7ce71cb588e","observation_id":"4e60121f-f687-41c5-9d8f-0ca7cd8355d7","resolution":{"observed_at":"2026-05-13T23:49:11.201312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-04T14:58:56.675148Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":"2407.14207","doi":"10.48550/arxiv.2407.14207","metadata_source":"pith","pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hanxiao Liu, Zihang Dai, David R","venue":"cs.LG","work_id":"854578cf-e114-4bac-998f-a9ee9f8c7dc2","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:630118989454d8a808a17bc94512054bedc42b4ab081087316fcf7583f2804b0","observation_id":"4f8c4a8a-ea21-43e5-9fac-0fe197c718e9","resolution":{"observed_at":"2026-05-13T23:49:11.207689Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":null,"work_id":"c10b5f69-8fd7-4199-82e0-ebb4d6f9af66","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:20bf4d0fa1a40566a8834f51446cf830111e2239d33ec4ee0835de3f5e81e360","observation_id":"63a52458-4462-4cf0-8b58-cc0cd304b900","resolution":{"observed_at":"2026-05-13T23:49:11.323725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06025","last_updated":"2024-06-10T05:15:30Z","snapshot_observed_at":"2026-08-01T02:17:38.806972Z","submitted_at":"2024-06-10T05:15:30Z","title":"RepoQA: Evaluating Long Context Code Understanding","version":1},"cited_work":{"arxiv_id":"2406.06025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06025","snapshot_observed_at":"2026-07-10T10:07:00.777401Z","title":"Repoqa: Evaluating long context code understanding","venue":"cs.SE","work_id":"baf8db96-cfa2-4564-9b6d-6ea0f09e0c73","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2406.06025","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:e46cc3a7bb561c2dcdd7ec7dfcd1edb9b0af24ae1e239bf7c0222393a92fd84f","observation_id":"6d4576bf-5aa8-450f-a4d3-344d67b44281","resolution":{"observed_at":"2026-05-13T23:49:11.214092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-07-10T21:57:38.615639Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:f8eda41a01eb3bc2d088ab880c354e764356e9b035dc06964eed3651e10b9256","observation_id":"51d4eab7-67fa-46b7-8794-9dbc0d13dfbf","resolution":{"observed_at":"2026-05-13T23:49:11.220159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:43a1526b2fe4076d0a1adaa2b2ce1fbdeffdb6fe4ad3b7b14166c0548f0bbc81","observation_id":"2242e950-55d2-4337-8d75-0495dc20700b","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08819","last_updated":"2025-03-05T23:00:57Z","snapshot_observed_at":"2026-07-06T17:59:38.202928Z","submitted_at":"2024-04-12T21:30:06Z","title":"The Illusion of State in State-Space Models","version":3},"cited_work":{"arxiv_id":"2404.08819","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08819","snapshot_observed_at":"2026-07-04T20:20:06.870632Z","title":"R Chris Miall and Daniel M Wolpert","venue":null,"work_id":"84888539-7324-4623-988f-1c4f49ba62ab","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2404.08819","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:874469324766dc70f7f165931c0ab6a5cdc5d4bf84652fbe6183165638627f50","observation_id":"66200db6-62e7-4e3c-913a-2c1d69659a7b","resolution":{"observed_at":"2026-05-13T23:49:11.232912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Parallelism Tradeoff: Limitations of Log-Precision Transformers","venue":null,"work_id":"49ef3111-fc43-4106-9c1c-de3c209e10f6","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:877e3ab61f70365c82d938353349c08bfac7bde97fb73e3f6f33b1bbabb8ee6d","observation_id":"8a415a66-6174-4cbf-8015-4c889de3c5a6","resolution":{"observed_at":"2026-05-13T23:49:11.375241Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:beeea5ec521a291674b308b057e13d20171269af53a405b2bc104c8f718728cf","observation_id":"e911b3eb-3eb6-4c01-be23-aac7d558d4b8","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":"2404.07143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-07-10T01:36:44.083287Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","venue":"cs.CL","work_id":"aecc8f73-1fd7-4a39-8ae7-a172b6a435b6","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:a2e4a089c31dd3801a790d9cacbd7335746b5eb333dad6845d5eed5808d8b021","observation_id":"77b4b1ca-7e21-4101-ab2c-95d04947c275","resolution":{"observed_at":"2026-05-21T18:17:00.308428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.05076","last_updated":"2018-07-12T14:40:06Z","snapshot_observed_at":"2026-07-06T06:50:03.471843Z","submitted_at":"2018-07-12T14:40:06Z","title":"Metalearning with Hebbian Fast Weights","version":1},"cited_work":{"arxiv_id":"1807.05076","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.05076","snapshot_observed_at":"2026-07-04T16:29:57.601323Z","title":"Metalearning with hebbian fast weights","venue":"cs.NE","work_id":"443a1a6c-ec73-45af-b3d6-b2920c77ba4f","year":2018},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/1807.05076","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:8476debb60adcb54834fff3489b3565fe0e0a72d86a7931d240793011c6f1e5a","observation_id":"882a95b9-ebc0-4a5d-bb80-7780dfd87455","resolution":{"observed_at":"2026-05-13T23:49:10.720077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09720","last_updated":"2019-12-03T14:16:23Z","snapshot_observed_at":"2026-08-05T00:32:53.544892Z","submitted_at":"2019-07-23T07:04:07Z","title":"Metalearned Neural Memory","version":2},"cited_work":{"arxiv_id":"1907.09720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.09720","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metalearned Neural Memory","venue":null,"work_id":"c6e64cbc-22be-4cb1-b807-c85615fcee16","year":1907},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/1907.09720","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:6d624087fc0de143156c5d1c8e9dec64d0fd95def4a784f71e848a014be3a06a","observation_id":"441b5449-afc3-4228-9ee1-2bbd26e46761","resolution":{"observed_at":"2026-05-13T23:49:10.726400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"cb8251bb-3cd5-41a2-aa75-0839f825a505","year":2022},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:d491bf58afed12b73ec83a570db52dcfccac16e01e3fe49d6bbafb4718014123","observation_id":"cf36d8cf-b571-431a-a695-936aba8aa585","resolution":{"observed_at":"2026-05-13T23:49:11.406596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-07-31T02:38:42.580244Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":"2503.14456","doi":"10.48550/arxiv.2503.14456","metadata_source":"pith","pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rwkv-7\" goose\" with expressive dynamic state evolution","venue":"cs.CL","work_id":"daf20308-c801-4745-a147-a1f1de4368e0","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:83e7887d6829600432373e8a295b0f50bfe2ea31f705f5ef9909052076dedc01","observation_id":"e7b91b86-1c81-4291-a7cb-f4248c0551a6","resolution":{"observed_at":"2026-05-13T23:49:10.733656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-07-10T20:07:33.546647Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:597f0d1eed03d01ab9c7fc2038fa2ba44e4d4788c5abc3a449516e2389bb1f73","observation_id":"12509223-439c-4f37-b229-c193ab976e8e","resolution":{"observed_at":"2026-05-13T23:49:10.739960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-07-06T21:17:23.576970Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"cited_work":{"arxiv_id":"2505.00315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00315","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","venue":null,"work_id":"2657c7cd-bbb5-44d4-8e0d-e5f8895c155f","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2505.00315","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:9497b7ca33fe2a6c38fbfbf7e67c278bcdf033adfb8be508afe6b063291511a9","observation_id":"4f23b4b7-3f5f-4dcb-ba2f-797b46b5f675","resolution":{"observed_at":"2026-05-13T23:49:10.746854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning with large language models, a survey","venue":null,"work_id":"e58fed3f-0280-4084-86f0-50770db3e764","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:a9dffb9e455f6e6b768fa38ef4629f1b29f02116f68f1e314413271261769fe5","observation_id":"4653c150-b14c-41a4-96b6-bd4b683b7159","resolution":{"observed_at":"2026-05-13T23:49:11.434014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","venue":null,"work_id":"85bb4d6e-40c2-4668-8dae-22d46aa80f6a","year":2022},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:9531563c6a4576cb1d04474689d32fbc813164f3dc70d8e01045eb2e8450e014","observation_id":"c67afc72-8999-4393-a746-66bb12c46865","resolution":{"observed_at":"2026-05-13T23:49:11.441905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08719","last_updated":"2025-04-11T17:33:32Z","snapshot_observed_at":"2026-08-04T10:54:30.836473Z","submitted_at":"2025-04-11T17:33:32Z","title":"SWAN-GPT: An Efficient and Scalable Approach for Long-Context Language Modeling","version":1},"cited_work":{"arxiv_id":"2504.08719","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08719","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Puvvada et al.SWAN-GPT: An Efficient and Scalable Approach for Long-Context Language Modeling","venue":null,"work_id":"42eb1a97-9739-4f03-8883-3f639f33fe5a","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2504.08719","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:3c3d41a7b622846346511aeebea894c5d28a09de49f1030bbf29a789c76edec3","observation_id":"c93cd242-856c-464a-ac27-e9f2b15970f8","resolution":{"observed_at":"2026-05-13T23:49:10.751896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07904","last_updated":"2024-08-19T17:16:55Z","snapshot_observed_at":"2026-08-01T18:05:06.274262Z","submitted_at":"2024-04-11T16:43:03Z","title":"HGRN2: Gated Linear RNNs with State Expansion","version":2},"cited_work":{"arxiv_id":"2404.07904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07904","snapshot_observed_at":"2026-07-03T17:28:44.977281Z","title":"Hgrn2: Gated linear rnns with state expansion.ArXiv preprint, abs/2404.07904","venue":null,"work_id":"62f21939-fe4f-4159-bb1e-6a303fdc7b42","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2404.07904","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:3992bdaa47ee6346b999e494cd475c773306044972a211278920bd14fa8c5c16","observation_id":"2fc4299c-e2db-4779-aba3-9f49db45f35f","resolution":{"observed_at":"2026-05-13T23:49:10.756376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"032dc2bf-a7b8-4926-b897-355d1b6c39f9","year":null},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:130bba380feecf49de62bb2430dc05a7b8c7397575fd2bc6cbd71c79d8c798ea","observation_id":"774a9802-38be-49da-93f6-7083d7017ea8","resolution":{"observed_at":"2026-05-13T23:49:11.259161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14995","last_updated":"2024-01-19T07:47:01Z","snapshot_observed_at":"2026-08-01T19:55:19.898676Z","submitted_at":"2023-07-27T16:45:33Z","title":"TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer","version":2},"cited_work":{"arxiv_id":"2307.14995","doi":"10.48550/arxiv.2307.14995","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.14995","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"org/abs/2307.14995","venue":null,"work_id":"99fe9fb2-bb01-4407-b04b-44fc5dfcebca","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2307.14995","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:8945f2b0c0bfff1de260aade72cb186b7fcf30473fca87db013c8aed317d4815","observation_id":"b16d595b-1101-4eb5-a673-a1bd80c3aa41","resolution":{"observed_at":"2026-05-13T23:49:10.761500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a3663bd-edbf-4df4-b986-e09e68d28539","year":null},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:ea8cfdb0461e08716164453044cca4fa5f7590f9a98ff6fcabfe2929c9e196aa","observation_id":"17eba7c3-97a7-43ee-93f2-0c151eac211e","resolution":{"observed_at":"2026-05-13T23:49:11.296630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:e52fc99a71cf4f9f5fe119932d1daa26704a9a11dbe76c662ce8d7cafc6389ac","observation_id":"afd76c00-2e1e-4de2-801c-17f45045ef73","resolution":{"observed_at":"2026-05-13T23:49:10.768666Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.21614","doi":"10.48550/arxiv.2503.21614","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Xiaoye Qu, Yafu Li, Zhaochen Su, Weigao Sun, Jianhao Yan, Dongrui Liu, Ganqu Cui, Daizong Liu, Shuxian Liang, Junxian He, and 1 others","venue":null,"work_id":"60838ff1-c009-4d82-9ac1-f2f40c5185f5","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:944550ebac600ad8f0a1b47480b7138773986eb63e777518d37c0531f209c743","observation_id":"84638362-7f83-420d-90dc-ac7754632ec1","resolution":{"observed_at":"2026-05-13T23:49:10.775427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed: 2025-10-27","venue":null,"work_id":"cce1c7f0-b8fd-43aa-8a04-3d57729c7d8e","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:2235fa96502329045df303c7d527e96e160a404f1b0fefbbc25f433aef09879b","observation_id":"063767e8-a890-45ae-a3c1-590696afd525","resolution":{"observed_at":"2026-05-13T23:49:11.327559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"65451e56-3eed-47fb-b51d-d1c7ddc969dc","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:358d79ee464960b5e8d89af8a44101916e18e4a72c4e1c927b885a1a6f991469","observation_id":"d79e880e-6948-45ee-8ddd-e8a7dac1d769","resolution":{"observed_at":"2026-05-13T23:49:11.357913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":"1907.10641","doi":"10.48550/arxiv.1907.10641","metadata_source":"pith","pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":"cs.CL","work_id":"9587a902-54ad-434e-9cbc-bdfe54b5d3bf","year":2019},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:8cba974bd699814dfc75dba8db988febd036920fa5942da158e02418bd4a5619","observation_id":"ab3a0f09-d42c-4ec5-87a8-6a66d8e457dc","resolution":{"observed_at":"2026-05-14T17:20:15.117976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear Transformers Are Secretly Fast Weight Program- mers","venue":null,"work_id":"a44d3263-4408-4dd3-8381-821205c615ec","year":2021},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:f8b17623513c4be72293aade018d5e3973ad5e4fad5cc9a6d5372ce3bc0c7601","observation_id":"10923a6f-0871-4b8a-b57d-d71ce819ea4c","resolution":{"observed_at":"2026-05-13T23:49:11.370713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.07831","last_updated":"2021-02-23T17:00:19Z","snapshot_observed_at":"2026-07-06T10:14:52.639480Z","submitted_at":"2020-11-16T10:01:23Z","title":"Learning Associative Inference Using Fast Weight Memory","version":2},"cited_work":{"arxiv_id":"2011.07831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.07831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Under review","venue":null,"work_id":"daf418aa-ee70-4293-bb18-dc519591e508","year":2011},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2011.07831","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:4158b18142647860943fd532211def97d75be6edd3991929907855677eb8a8c2","observation_id":"6a949274-7c9c-47dc-ae57-35946c3ed910","resolution":{"observed_at":"2026-05-13T23:49:10.787850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02155","last_updated":"2018-04-12T18:51:33Z","snapshot_observed_at":"2026-07-06T06:26:51.386842Z","submitted_at":"2018-03-06T13:13:11Z","title":"Self-Attention with Relative Position Representations","version":2},"cited_work":{"arxiv_id":"1803.02155","doi":"10.48550/arxiv.1803.02155","metadata_source":"pith","pith_arxiv_id":"1803.02155","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Self-Attention with Relative Position Representations","venue":"cs.CL","work_id":"da5a9ff2-720f-44e5-a2f8-cf74d9bcc837","year":2018},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/1803.02155","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:9d69e2e8c947498a969fe0adc8db914ea6915b84c1deb70b8cbe901062e2c788","observation_id":"cbdc2c05-5af4-4ce8-a388-0cca208df207","resolution":{"observed_at":"2026-05-13T23:49:10.793874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"June 2025.URL:https: //kexue.fm/archives/11033","venue":null,"work_id":"edd6e7d8-4873-4afc-83ef-02e3ec5141bc","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:56acd73577a4efc4e940149f1c496fe02eaeca67416795341f56de67771ecd2a","observation_id":"85c2dd83-3392-486e-9041-9f1483d50d84","resolution":{"observed_at":"2026-05-13T23:49:11.398060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"8687f3f8-601b-4cec-a98b-e24b9bce4e60","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:39076bd4257287eb101195f222912ff0f077db74af6b49e63666ad510941809c","observation_id":"7486701c-c8a6-4028-bc28-4c0bf795ba7d","resolution":{"observed_at":"2026-05-13T23:49:11.402606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09834","last_updated":"2025-08-13T14:13:46Z","snapshot_observed_at":"2026-07-06T22:12:26.366922Z","submitted_at":"2025-08-13T14:13:46Z","title":"Speed Always Wins: A Survey on Efficient Architectures for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.09834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09834","snapshot_observed_at":"2026-06-30T08:44:28.037573Z","title":"Speed Always Wins: a survey on efficient architectures for large language models","venue":null,"work_id":"fd87decc-a230-45f1-a04f-3b4579027843","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2508.09834","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:9f2aa90234b483cfc9146b9a6959ee21327cc77f9a8ed2e083e4f23413f021f5","observation_id":"990f7d6a-f121-4932-9ec3-3363c7c2146e","resolution":{"observed_at":"2026-05-13T23:49:10.800523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":"2407.04620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-07-09T18:46:26.563289Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","venue":"cs.LG","work_id":"c682430c-e7a2-4699-b82d-55287448dbba","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:4f6817ae472826abc03afd6cc6a6a3eff04cdc494e536a42d3d7c246675a1ee1","observation_id":"004a5311-af12-4e4f-8e52-91223d9cc6ce","resolution":{"observed_at":"2026-05-15T05:20:12.625336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.19595","doi":"10.48550/arxiv.2507.19595","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Efficient attention mechanisms for large language models: A survey","venue":null,"work_id":"3dee237c-3b7e-46c4-a234-67b9bed9b5f1","year":2026},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:a5c931474c06783bec3ac6d35f97f60fa5c775282f499aecc1ddb9f6acc10a3d","observation_id":"917f015e-b783-4ccf-b603-14377a5dfa85","resolution":{"observed_at":"2026-05-13T23:49:10.813030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:0ba7f9206b78b5de46f0ddf3c2d0753354590314cacdc35191c0576a8347a59d","observation_id":"e72ac2af-e83b-410e-8028-42648d562ff3","resolution":{"observed_at":"2026-05-13T23:49:10.818760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:21565d66abb572ff7d5e6cc3457acbb53e73530acb08f7820eb5df424ea294b2","observation_id":"6e83b91d-a9ee-496d-9d4f-db0645586b0f","resolution":{"observed_at":"2026-05-13T23:49:10.824263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:1b1ef2d4c2fe02c71c9709d08ca01180c85eaddef06b9577c4371fdb6d31a1e2","observation_id":"443e8cf7-abd1-4ef7-9828-f5ba06cca594","resolution":{"observed_at":"2026-05-13T23:49:10.829649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-10T22:47:36.964713Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:58ced97ad0bdf669a8d2994aeecc73f52b8f3f63f185945c17ad0c1dedbc3cbc","observation_id":"3ee9956e-6d00-4ef4-aa60-664224a7a13f","resolution":{"observed_at":"2026-05-13T23:49:10.836472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07900","last_updated":"2025-09-04T16:23:02Z","snapshot_observed_at":"2026-07-06T21:39:08.559358Z","submitted_at":"2025-06-09T16:16:50Z","title":"MiniCPM4: Ultra-Efficient LLMs on End Devices","version":2},"cited_work":{"arxiv_id":"2506.07900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07900","snapshot_observed_at":"2026-07-02T19:47:19.779661Z","title":"Minicpm4: Ultra-efficient llms on end devices","venue":null,"work_id":"344177ee-2d25-4b76-9c86-71e254c2d162","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2506.07900","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:fa2cc4d2d0e23214ef011535cbd9dc11572c16d7bf97434647c4c6b0bfda9c84","observation_id":"04169612-8244-4ffe-a3de-011172babba4","resolution":{"observed_at":"2026-05-13T23:49:10.845126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.15431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:47:59.860075Z","title":"Hunyuan-TurboS: Advancing large language models through mamba-transformer synergy and adaptive chain-of-thought","venue":null,"work_id":"9ae57c73-663b-4d9f-8664-22dba330b5aa","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:81d0b301f694268397fbd9ae3ab670932bc26f6e6c8962fc35217aad8760410a","observation_id":"c59bac0b-b5bc-4a97-b5c1-db724dec4ad3","resolution":{"observed_at":"2026-05-13T23:49:10.852510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":5,"verified_exact":64,"verified_fuzzy":22},"total_outbound_references":129},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 129 outbound references and 83 inbound Pith citation observations for arXiv:2510.26692."}