{"as_of":"2026-08-12T22:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:398c68b6d97eeb1d966ff96f0ef324d3149f1f8223774c3788bdbcaf605a0716","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T22:34:36.108826Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06501/citation-record","integrity":"/paper/2605.06501/integrity","json":"/paper/2605.06501/citation-record.json","paper":"/paper/2605.06501"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"e82a4005-aeb4-4ef2-8d4a-fe5afa7d1d7b","year":2023},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:d8a2fcaaa42c096e7e842884807f8272e629c654ec7dc9e71a78381228a79061","observation_id":"3cd32c7b-6e29-4661-a4c7-40fa0a91565f","resolution":{"observed_at":"2026-05-20T22:54:11.342105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":"1409.0473","doi":"10.48550/arxiv.1409.0473","metadata_source":"pith","pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","venue":"cs.CL","work_id":"d831e763-d530-4029-a65c-ac595d82cb2a","year":2014},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:75b01862a816853474519852c465ee70d2536e91addb1fd06bc7c011e205b056","observation_id":"9389c036-304b-4998-a093-9f19c148d863","resolution":{"observed_at":"2026-05-20T22:39:11.028153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effect of dimensionality on convergence rates of kernel ridge regression estimator.Journal of Statistical Planning and Inference, 236:106228","venue":null,"work_id":"d9ec9aa9-4b32-46a3-be05-372f3ec81865","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a753a85b224f7658b8d2923a3e12fbffc65075759a5898c90dc0828aa931700c","observation_id":"1d0a5a9b-a046-45f9-a2e7-4a0c9afc7939","resolution":{"observed_at":"2026-05-20T22:54:11.448696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overfitting regimes of nadaraya-watson interpolators.arXiv e-prints, pages arXiv–2502","venue":null,"work_id":"075549fd-a8be-48db-bc3e-981ab79bede3","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:489a8b428d0e419d65fd4b7464ba14bb2e4bddc1ed9d06e570ec92aeffa7b807","observation_id":"fd870da3-8175-4266-9482-e28584ec51f8","resolution":{"observed_at":"2026-05-20T22:54:11.302557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xlstm: Extended long short-term memory.Advances in Neural Information Processing Systems, 37:107547–107603","venue":null,"work_id":"39f89637-2a64-431a-a88f-7b0fd6f9190f","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:55e940d23384c88298b56087357f887a42fa8c4086008caa1d6fb827734f9d5a","observation_id":"b39b649d-6937-4392-a18f-31ef0ea34d1f","resolution":{"observed_at":"2026-05-20T22:54:11.329690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sage","venue":null,"work_id":"12be41b1-5e84-44e7-b43a-da1c74827529","year":2004},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:1cf16b7d869d2de14e5cbc333ff96c58e023240ef73ddcfde0e36c4375b49968","observation_id":"35fc128b-f9d6-4f0b-b434-7728fcb83df0","resolution":{"observed_at":"2026-05-20T22:54:11.290170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piqa: Reasoning about phys- ical commonsense in natural language","venue":null,"work_id":"82c8ee4d-8ddb-4d2f-a5b0-484d0cc24317","year":2020},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:68f18af45e7480d8a527a0e234e7ff26c4572dc28995145844708da75fdc83c6","observation_id":"ed13f0a1-2252-4c77-9aeb-7d697c77442f","resolution":{"observed_at":"2026-05-20T22:54:11.231787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"b10f1f7e-5234-4e07-b5fc-1905283c95e4","year":1901},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:c56b82215b6538b3372dd6b5ae061bb59fa278420e9fd2dbf30a86247a4adfd8","observation_id":"09fb5123-df84-4029-a0c2-305573e40c05","resolution":{"observed_at":"2026-05-20T22:54:11.388273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Local linear regression estimator on the boundary correction in nonparametric regression estimation.Journal of Statistical Theory and Applications, 19(3):460– 471","venue":null,"work_id":"523d6137-8731-4b9d-86ff-85d853f542ca","year":2020},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a6441eddac104f8d515ed4b42e78baa3a1b3890d89bd80a732054110db983905","observation_id":"69205e0c-4348-4a69-99b6-f361030057db","resolution":{"observed_at":"2026-05-20T22:54:11.357953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:81214dffb9edbe6600c6066fd9b9e9262da491f803a9088295b81c8c8ee6d72d","observation_id":"a8739443-cc13-40ee-b1b2-bd93735368c3","resolution":{"observed_at":"2026-05-20T22:39:10.922193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lowess: A program for smoothing scatterplots by robust locally weighted regression.The American Statistician, 35(1):54","venue":null,"work_id":"21c37bda-a7c1-4998-aec4-5861201d3c13","year":1981},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:0e7e67f1c1c3659c938c2dd5c7ae348fc5653c740e434f1563cc7edf8776756c","observation_id":"1351c7ee-03d3-407d-a125-3d4459e44969","resolution":{"observed_at":"2026-05-20T22:54:11.325677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Locally weighted regression: an approach to regression analysis by local fitting.Journal of the American statistical association, 83(403):596–610","venue":null,"work_id":"5a371d03-4f4e-42cb-8363-115cea5099b8","year":1988},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:db7693f7ff102d8a1e483d443cfea2f94d5b3048c3351103f5346ee441085309","observation_id":"c0fa2640-d71c-45c1-aa2d-4410fb91c4cf","resolution":{"observed_at":"2026-05-20T22:54:11.274454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smoothing by local regression: Principles and methods","venue":null,"work_id":"ca752cfd-f9db-41ff-b84c-b98605417e7f","year":1994},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:172b3ca9344614410563afc6744444f598af53985fe4a8690083741cedf462bb","observation_id":"7964a6cd-02d0-4b67-9a4f-b712f75db11b","resolution":{"observed_at":"2026-05-20T22:54:11.413000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xu, Huazuo Gao, Deli Chen, Jiashi Li, Wangding Zeng, Xingkai Yu, Y","venue":null,"work_id":"817edeef-ead8-47a4-9f56-b1e54c283962","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:fb7b71c5589f84f37f862d68c281dd0975fd39825cc3086c76fef9439a5e82a6","observation_id":"d5f68992-8558-40b8-b253-08432bdb037b","resolution":{"observed_at":"2026-05-20T22:44:12.028647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:7cf010e6d0a9442b9e9360d10668f3946eb6cffcf8bdcf108b6a9757a1b92932","observation_id":"38d6497b-2208-4f9b-a485-673a3320c703","resolution":{"observed_at":"2026-05-20T22:39:10.982579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogview: Mastering text-to-image generation via transformers.Advances in neural information processing systems, 34:19822–19835","venue":null,"work_id":"0f4c2ea5-67cc-40df-b2ca-866e31177a2d","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:9867a8ec2e67f1e11d5457e1fb4f3809ea18d731c65a8060b61f83b87bcf5cf7","observation_id":"f86b60be-0106-43e8-94ac-982c86dad130","resolution":{"observed_at":"2026-05-20T22:44:12.014619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finding structure in time.Cognitive science, 14(2):179–211","venue":null,"work_id":"47847a42-7f6a-4844-b2af-1955132bd8d7","year":1990},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:942497d282ecca0e1d073c646c9fa7b671e5b0542c5c29a097abd05a074b1dc7","observation_id":"e178af23-550f-457c-b14a-31ad09366cd2","resolution":{"observed_at":"2026-05-20T22:54:11.417177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distributed representations, simple recurrent networks, and grammatical structure.Machine learning, 7(2):195–225","venue":null,"work_id":"03d48298-a748-497a-9e8f-d80709c8f297","year":1991},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a75ebd64ef058133a4df859744d1794f1a37bfcc0982da8f9b75298c859fca11","observation_id":"2926d3b0-8ca5-460a-a01b-e7aa90d27672","resolution":{"observed_at":"2026-05-20T22:54:11.206500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semiparametric estimates of the relation between weather and electricity sales.Journal of the American statistical Association, 81(394):310–320","venue":null,"work_id":"2d0a9404-13b0-4fcf-8cc8-1771c6c07698","year":1986},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:108baaf521ee5614c4ed4b7c9dc94d68100b7a9b460902211085a01013dd2c97","observation_id":"e87233df-1d01-4535-b3e1-362ffc62ebe7","resolution":{"observed_at":"2026-05-20T22:54:11.452970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.638286Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39","venue":null,"work_id":"34699817-8561-4043-bbe1-445a0c93266b","year":2022},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:7b3585a636fa7c28edc52642f55eafee4ea7ff2b7822db8ff84f355d09008e85","observation_id":"2dd1b53e-c9f7-4988-8775-27cf105745c7","resolution":{"observed_at":"2026-05-20T22:54:11.294611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"USAF school of Aviation Medicine","venue":null,"work_id":"2aeb8a6d-d96f-4488-95c0-4e00177a9700","year":1985},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a4e172a58cb0001bb8e6030f29d216b60df718cfbac26e44865aa0b6efed79e2","observation_id":"7b98e20e-8b8b-4121-81ff-af80e705d706","resolution":{"observed_at":"2026-05-20T22:54:11.250249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"cambridge university press","venue":null,"work_id":"7e12d6dc-a9aa-4f3c-960c-bd9385a600c1","year":2009},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:be2e06a20d81c52650cb8bb18da995b68d2c95b7320cbdfe1cfd04cfd9b29d24","observation_id":"aa37e564-0474-4dad-b701-172321ea2013","resolution":{"observed_at":"2026-05-20T22:54:11.370223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:44:12.851583Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":"9148854a-4b09-4c5d-b1a4-5ee9cccc772c","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:b4b6919a215656a9a5c2b3e68363f240c182f022605dd43448ba95881d0813ad","observation_id":"f0619385-4431-44e4-bbfe-93cc9d11990f","resolution":{"observed_at":"2026-05-20T22:54:11.315756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:45:56.149174Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":"8ed91ed5-c5c0-4292-be54-e31c0383e9b4","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:72dc72e95defab760ab8e8076f53640bbc1a6601562de56bfee20fa93ed38604","observation_id":"2414bea9-e12a-46fa-b2c0-c69eaceed855","resolution":{"observed_at":"2026-05-20T22:54:11.192840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:16:17.490402Z","title":"Long short-term memory.Supervised sequence labelling with recurrent neural networks, pages 37–45","venue":null,"work_id":"ad42118f-f2a7-4445-9c80-9cde4d1ad42a","year":2012},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:b88f580a5ef36fe0824928538ef0cabfcdf5f43d9e435482436bbbbd5bfa09c0","observation_id":"02054263-c05d-4ef2-8771-85d94309143f","resolution":{"observed_at":"2026-05-20T22:54:11.188156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":"cbab905d-7336-49d0-8abe-f45914fc31d3","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:c8a9bce8e2cb4a5cbd3fe16166ed33190134d9413ffe46ceb247541c7bc2a0da","observation_id":"41645897-b28e-4760-a559-ffa6f1fd0814","resolution":{"observed_at":"2026-05-20T22:54:11.211702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the parameterization and initialization of diagonal state space models.Advances in neural information processing systems, 35:35971–35983","venue":null,"work_id":"5155c334-6a27-4143-aefe-a91c3fcb9a67","year":2022},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:f65380610c8947d7e0b9a04fa83eba6d6ef9d4a1778cfea0e3516203486f1de7","observation_id":"8d2ca290-e5da-4d06-a733-ac1755e99c7c","resolution":{"observed_at":"2026-05-20T22:54:11.259192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":"2111.00396","doi":"10.48550/arxiv.2111.00396","metadata_source":"pith","pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","venue":"cs.LG","work_id":"4150b761-b8bf-4d9b-a2f8-cb2d1b73d378","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:d298ad5bd5bf233bd18f9178e28bb76a1281d052321ab5e26156ffdd083cb284","observation_id":"f342ff50-70c4-46e6-be4f-b4dd48012a69","resolution":{"observed_at":"2026-05-20T22:39:10.848414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Local kernel ridge regression for scalable, interpolating, continuous regression","venue":null,"work_id":"6e8eff3b-0383-4a9b-841c-e66a71c3ede6","year":2022},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:ca233bf42cbad942671841d35ba40c6904466da14c3ceb9f31a1551b4523794a","observation_id":"800c1e98-2b7e-48ef-a4b3-ad615d2d4fe9","resolution":{"observed_at":"2026-05-20T22:54:11.366558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:55.367441Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"9a00f23b-71b4-4f99-a115-0d30a296f178","year":2016},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a2b53b827e203f72248b1a3dd4e313390d62953a997370c5a44eeba58bae06c5","observation_id":"5a987d0d-b33c-47af-a8fb-72cb5f33bd57","resolution":{"observed_at":"2026-05-20T22:54:11.397064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.641860Z","title":"Neural networks and physical systems with emergent collective computational abilities.Proceedings of the national academy of sciences, 79(8):2554–2558","venue":null,"work_id":"f0fa9aaf-4583-42eb-8764-5f616f48ce2c","year":1982},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:8299ef860a0fbb8059d6d1ebed21e40440ef3a76c2cfa31eda71e4adb053bdab","observation_id":"650680e2-de19-446e-a946-11d541c5ec71","resolution":{"observed_at":"2026-05-20T22:54:11.338121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Consistency of local linear regression estimator for mixtures with varying concentrations.Modern Stochastics: Theory and Applications, 11(3):359–372","venue":null,"work_id":"ecf9c392-2c46-4668-aeb6-e16805dc6419","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:58528c3872b60bbe5773e4a7404a0125ca488e5c295662276819923e0c7f2ae7","observation_id":"10edbc50-ab2a-49de-85aa-afc59807009d","resolution":{"observed_at":"2026-05-20T22:54:11.319835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.960357Z","title":"Densely connected convolutional networks","venue":null,"work_id":"f4c2fe48-9b67-4e31-a785-f163d3f49600","year":2017},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:4e30f0423f45a167f95e3155577247608bb65cd2f19a24d1f8ac68f0b9f5828e","observation_id":"2e27e45d-55d5-4f1a-853b-fb1820cddbe5","resolution":{"observed_at":"2026-05-20T22:54:11.346025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.786168Z","title":"Adaptive mixtures of local experts.Neural computation, 3(1):79–87","venue":null,"work_id":"9a4f56aa-50c0-4200-919d-0d2973bd24be","year":1991},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:0ad9a530763792867f6bb140545b7de910f7522e0f652bc6451da2a63d20b5d7","observation_id":"d0299a44-4e38-491e-b796-bbc441d551b6","resolution":{"observed_at":"2026-05-20T22:54:11.263248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:54cd95ee10016b618e66b1f11493cb385e979ceafa4b0571898aed9af352b275","observation_id":"d13ee1ff-60d3-4f00-aad5-895d09972037","resolution":{"observed_at":"2026-05-20T22:39:11.033658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improvement of boundary bias in nonparametric regression via twicing technique","venue":null,"work_id":"29a7aa53-627d-4499-9fe4-90f6275d435c","year":1997},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:8e7baa5bd6c0c971e273a4f16941a557d00cf9aa2d8616200c8512a9a2dc59b4","observation_id":"77a04c9a-8de3-4633-9e76-eefd5d294483","resolution":{"observed_at":"2026-05-20T22:54:11.457171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Serial order: A parallel distributed processing approach","venue":null,"work_id":"3a45da35-1ab1-4ffc-a255-817c27b1c5b4","year":1986},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:44c1be49ea9fee7873de0c9c4ff8e35b88a4ea40193bf740babfce1e89c40171","observation_id":"60a44c04-53cb-44dc-a391-5ee20deea6fd","resolution":{"observed_at":"2026-05-20T22:54:11.440176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finetuning pretrained transformers into rnns","venue":null,"work_id":"c8bcc991-d63c-4f2a-8cf4-6df30bb7dc58","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:accd7bdb16af3977e8a608c468db031f6a0bf6f7c4a3a6167711f0dd0d013f08","observation_id":"f0f3864a-1821-44e2-8cec-c404d9f43eca","resolution":{"observed_at":"2026-05-20T22:54:11.226207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07959","last_updated":"2017-10-12T17:05:47Z","snapshot_observed_at":"2026-07-06T05:12:12.264453Z","submitted_at":"2016-09-26T13:12:51Z","title":"Multiplicative LSTM for sequence modelling","version":3},"cited_work":{"arxiv_id":"1609.07959","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.07959","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiplicative LSTM for sequence modelling","venue":"cs.NE","work_id":"97bc7655-1c7d-4522-9c03-ab85fd9a2b7d","year":2016},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/1609.07959","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:59c381335df0f64d02538d9f819614469974313e4e76a943083151b76f62033c","observation_id":"63326634-8844-44d3-9a1d-47cf3ffd071a","resolution":{"observed_at":"2026-05-20T22:39:10.878842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Race: Large-scale reading comprehension dataset from examinations","venue":null,"work_id":"dd92424f-624e-40d6-bb8b-ed63eb6fa3a4","year":2017},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:541d84bc2dc41c8e53cb769ba8ce7a806ea043c2bbdda38b35d1707c86b017ee","observation_id":"69fd178a-08bc-4d84-82f8-6c41baee5027","resolution":{"observed_at":"2026-05-20T22:54:11.444696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11238","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Virtual width networks","venue":null,"work_id":"85d08cd2-c306-4953-a3bc-d5d36ff113b6","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:f92e1e67743d59adfeba4d1910c1d61ddf200a0a0028e25ef289600c7121c232","observation_id":"1b209e28-43ad-4360-8353-c78663456bbf","resolution":{"observed_at":"2026-05-20T22:39:10.955873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-LLaVA: Learning united visual representation by alignment before projection","venue":null,"work_id":"07997d09-0ab7-49b0-aa3c-2ccdb1b8eda6","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:0a050d298dff6ff3533c8462ea8c8ba7c840fd4374aac30f4a59f2426c967399","observation_id":"88046b56-d230-4829-befd-1e069c3c2026","resolution":{"observed_at":"2026-05-20T22:54:11.241009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:21.198691Z","title":null,"venue":null,"work_id":"c69dcc4d-85af-4249-accc-cbae1a0e230c","year":null},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:052622d02826fba7e564b17382fa1a31c357bffed97b938579d5a976034477e0","observation_id":"f8a73630-c9ae-413f-a5f3-1443e2188ac8","resolution":{"observed_at":"2026-05-20T22:54:11.379149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:f325108cf1b24ee44e4fb923d2cc1f41c0e8b965eefd3957cc0b9d14f0a9088e","observation_id":"9a1859d0-1182-4540-b5c8-ed1bbb324ab2","resolution":{"observed_at":"2026-05-20T22:39:10.942676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15718","last_updated":"2025-04-11T12:55:40Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T04:57:59Z","title":"Optimal Rates and Saturation for Noiseless Kernel Ridge Regression","version":2},"cited_work":{"arxiv_id":"2402.15718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15718","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal rates and saturation for noiseless kernel ridge regression","venue":null,"work_id":"d184d4be-5524-4a6d-8103-74305973d574","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2402.15718","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:09466e582d22fdfc2650f9f1e061bdb659936f10fdbb4913340b02488c726ac7","observation_id":"7b328801-37d7-4899-87c8-845b70bb08c6","resolution":{"observed_at":"2026-05-20T22:39:10.930614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fineweb-edu: the finest collection of educational content","venue":null,"work_id":"9780320c-b00b-40a3-970f-9f6c873cdf66","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:d38d5234474e098fb7c0f3a32e4ecd602fa59f69ab07c57c5bc559270898a775","observation_id":"fde5c969-e598-49db-b1ea-530b2aa845a5","resolution":{"observed_at":"2026-05-20T22:54:11.216749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megalodon: Efficient llm pretraining and inference with unlimited context length.Advances in Neural Information Processing Systems, 37:71831–71854","venue":null,"work_id":"7cd20d3f-3418-499d-9ce9-a4c35c46d605","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:80c2a025721bf91d538ec3594af06b3a00bbbe29df37e227f71af4ade008eae0","observation_id":"d705d7dd-1f16-4931-bb8a-3814b3d7a5ac","resolution":{"observed_at":"2026-05-20T22:54:11.353622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the smoothing of time series","venue":null,"work_id":"65f567b7-58a5-4d0b-a794-4090aa871a48","year":1931},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:433674ff3e6f8f3cbaec4e230029f22a44fb833ed0d54af7d4b3114bf3baf4fd","observation_id":"d557d13e-a8fa-48e1-aba7-b224d8bd2e18","resolution":{"observed_at":"2026-05-20T22:54:11.362683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallelizing spectrally regularized kernel algorithms","venue":null,"work_id":"863d50f4-cd69-4bb5-8d85-2e6a5493f3bd","year":2018},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:b802b735914b2119a2387d6277635a870c0ca8d5575f49751d5ec34068088135","observation_id":"310d9d7b-ac17-407c-998e-587e1a9acc9b","resolution":{"observed_at":"2026-05-20T22:54:11.307047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"6d5ae5a4-a0f9-47fe-9e29-6ceecc81055b","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:235e79abed3fad4f8659d210b35dda02fe3af7f4351ca3f936ccace8e450feef","observation_id":"8c4a84ed-1eae-46bf-aa11-788dcff512c5","resolution":{"observed_at":"2026-05-20T22:44:12.036697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regularized least squares learning with heavy-tailed noise is minimax optimal","venue":null,"work_id":"81557a9f-4ea4-4e8b-b0e6-09f21dce43a5","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:c2cbafee771a769b736cddcc45d973026404697c75b32a9567de6968fe68bc60","observation_id":"3c0e1cce-5dc4-4edc-bcd3-ac30f1443fa2","resolution":{"observed_at":"2026-05-20T22:39:10.894490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIT press","venue":null,"work_id":"fbdc3159-8113-43c6-bd94-a32c0f681c9c","year":2012},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:8b688592170e86018e0e86f4d9ff55c0ca189335803d3b81e7cdf49bfb101faa","observation_id":"616e536d-e283-46ce-a189-8016a4d51f82","resolution":{"observed_at":"2026-05-20T22:44:12.032608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wf sheppard’s smoothing method: A precursor to local polynomial regression.International Statistical Review, 87(3):604–612","venue":null,"work_id":"23dad36c-4235-4704-a8d8-469af2efc46e","year":2019},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:ae98a31b59b9aaf08718980a05992cef9e5784b93f8f20f432a1fe29d505a199","observation_id":"85aa1e2c-3834-4b2d-8321-b9ab3da7dd08","resolution":{"observed_at":"2026-05-20T22:44:12.024146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On estimating regression.Theory of Probability & Its Applications, 9(1):141–142","venue":null,"work_id":"19e21661-429d-4bf8-b544-a0c5ef3148f3","year":1964},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:536af89a9caae7d161aca4e0ee3a63cbd91d2aee2fd7cc072b8cde01b89c0de4","observation_id":"a24552d1-c512-4680-9ccd-f4c74819c880","resolution":{"observed_at":"2026-05-20T22:44:12.019693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized linear models.Journal of the Royal Statistical Society Series A: Statistics in Society, 135(3):370–384","venue":null,"work_id":"f4280b28-c771-4d33-9173-449669bd181d","year":1972},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:371ca69379b9ffb796c6a031054d2e59348bffd315d710111e68e983640841eb","observation_id":"b4be7a0f-dde4-4604-8231-7098c160c48b","resolution":{"observed_at":"2026-05-20T22:44:12.008517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:53:40.566568Z","title":"Pytorch: An imperative style, high-performance deep learning library.Advances in neural information processing systems, 32","venue":null,"work_id":"262300a3-c1d4-4d6e-ac74-8a4100dd12c8","year":2019},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:469f7c035ef692e880fef6e817eebd6d3540c5f1204d603db1397e37cd226662","observation_id":"195a5180-2c46-4349-ab53-468d6b51cb04","resolution":{"observed_at":"2026-05-20T22:54:11.270552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"d616a4c6-d8b8-4a96-a47c-a466c54b12d2","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:6642154ed6eb93cb464f9f5578edb818f825f5efd9db9666bdded8870672b278","observation_id":"e2ad8673-ef16-4239-85b6-e54f2f35623a","resolution":{"observed_at":"2026-05-20T22:54:11.461431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-08-07T16:54:15.957609Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":"2503.14456","doi":"10.48550/arxiv.2503.14456","metadata_source":"pith","pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rwkv-7\" goose\" with expressive dynamic state evolution","venue":"cs.CL","work_id":"daf20308-c801-4745-a147-a1f1de4368e0","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:04b4756cdbf98c68f5ce38fd489a89a838c030f231f3b4e1fc3611d64d368511","observation_id":"fc457ba4-ca7a-41dc-a11c-836b0d4a9cf5","resolution":{"observed_at":"2026-05-20T22:39:10.989589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":"272f0250-4373-420b-8395-bd17bd037930","year":2022},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:582aede55e2ac7e64190fed8fee3612035b369871c64ae0fe69671e20bf0c6f5","observation_id":"c5a5bf37-9851-417f-a212-f60baa66dd19","resolution":{"observed_at":"2026-05-20T22:54:11.409686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"df04463b-686a-4c1d-b630-83a668387d85","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:4eafd9635264341be628e1ea20d9f3d00ae9aa5644828311686672a686107ccd","observation_id":"e93f9185-481f-4b1f-9899-1e2165c989ea","resolution":{"observed_at":"2026-05-20T22:54:11.431275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07904","last_updated":"2024-08-19T17:16:55Z","snapshot_observed_at":"2026-08-09T13:09:57.457279Z","submitted_at":"2024-04-11T16:43:03Z","title":"HGRN2: Gated Linear RNNs with State Expansion","version":2},"cited_work":{"arxiv_id":"2404.07904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07904","snapshot_observed_at":"2026-07-03T17:28:44.977281Z","title":"Hgrn2: Gated linear rnns with state expansion.ArXiv preprint, abs/2404.07904","venue":null,"work_id":"62f21939-fe4f-4159-bb1e-6a303fdc7b42","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2404.07904","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:3d65a93668d1367c03b707f1db7591d40ff193f6c0e4ef200abdeb50426b98eb","observation_id":"c8242dce-7d6d-41ea-ac26-ad571e9917a8","resolution":{"observed_at":"2026-05-20T22:39:11.022749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:0fcdf525298316f60ecc6577b46c64c37e6aca3ea0bf57fabce996993a241f0d","observation_id":"ec011d2a-6ed9-4e90-98af-c8e53f0e38ff","resolution":{"observed_at":"2026-05-20T22:39:11.014913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04431","last_updated":"2025-01-22T01:18:51Z","snapshot_observed_at":"2026-08-10T13:53:56.915968Z","submitted_at":"2024-09-06T17:53:26Z","title":"Theory, Analysis, and Best Practices for Sigmoid Self-Attention","version":2},"cited_work":{"arxiv_id":"2409.04431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04431","snapshot_observed_at":"2026-07-02T21:17:24.595834Z","title":"arXiv:2409.04431 , year =","venue":null,"work_id":"bd8c2a0c-3687-469e-b571-f246b747a7a8","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2409.04431","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:41cc35efc0a2850d4b9f7ae6046ae747015584af1ff022495753515fa2d0544c","observation_id":"b7950fc4-5026-4447-862f-bced4a513992","resolution":{"observed_at":"2026-05-20T22:39:11.009258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.06607","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:59.569239Z","title":"Decoder-hybrid-decoder architecture for efficient reasoning with long generation","venue":null,"work_id":"ccb39039-6692-46e3-8e2f-ebe4b6d8a3a4","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:df9026bba6e39c1da819cb6e24bcc2816f787d063e6146ecb55ad1df8735faef","observation_id":"b6a8c579-8b2b-416b-825d-85ab548119e3","resolution":{"observed_at":"2026-05-20T22:39:11.003131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":"41385563-2ae3-4e73-9407-8373059a8fbc","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:426ebcd66e9f40b860ff30ec71cd907b79cfaac4b2d4943d96de3fe0c7638daa","observation_id":"15f80da7-1427-450e-aa32-62395b065def","resolution":{"observed_at":"2026-05-20T22:54:11.266880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hash layers for large sparse models","venue":null,"work_id":"3b6b2169-f42e-4107-9b1b-906270eb1a23","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:66b5dd189e9b4396539adf661ba68910228085cc041ed05fcc1c3ffe8de9ab19","observation_id":"10d5efbc-2b0c-400b-a13b-3a61f805bda5","resolution":{"observed_at":"2026-05-20T22:54:11.423016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:05:09.037434Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106","venue":null,"work_id":"2a37a93b-1467-4ea5-94be-d5ec6f87efc3","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:9728b9fb5d0bf1db1e4fc2e6153974b9c38aa66ad1f7b0dfbdc04af0ee05df9e","observation_id":"7de02987-c30b-4942-a52a-a9fa3481b70b","resolution":{"observed_at":"2026-05-20T22:54:11.197231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social iqa: Commonsense reasoning about social interactions","venue":null,"work_id":"a6420a82-05c3-4cdc-80d5-a8eecd0b6924","year":2019},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:ea8fa670e72c5c5dc658b247cc85490fcceefee3207e63c3e75dcb0955c5f22f","observation_id":"93dfce1b-899c-49ab-b6b8-3a0a9da2c894","resolution":{"observed_at":"2026-05-20T22:54:11.278339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.455612Z","title":"Learning to control fast-weight memories: An alternative to dynamic recurrent networks.Neural Computation, 4(1):131–139","venue":null,"work_id":"862a421b-3843-409b-bfd7-de870fd8b860","year":1992},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:0bd8feb37c600d38b93e6fcc3b89d8bd6c22da4751e268b1388b3cb8f14a74d0","observation_id":"cec03fcc-7bed-4876-a52b-5bc46f282596","resolution":{"observed_at":"2026-05-20T22:54:11.183479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:23685c6014edc0112792b6da8b6e9e44a345d28f0a3d428fe40f6eda3e41a4a6","observation_id":"defbe0e4-c9bd-42e6-8add-6a53020fbcee","resolution":{"observed_at":"2026-05-20T22:39:10.856411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"c59795be-9dc9-49a0-94de-3dd7a441ee42","year":2017},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a4cea2fec486b00bfc761241a167e41b71e0bf78d48a09bc7ef41ae9b7c24b98","observation_id":"718b8f28-9fb2-4714-9ac8-63d6d0d31d70","resolution":{"observed_at":"2026-05-20T22:54:11.282255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07413","last_updated":"2024-04-11T00:52:39Z","snapshot_observed_at":"2026-08-09T06:38:13.784365Z","submitted_at":"2024-04-11T00:52:39Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","version":1},"cited_work":{"arxiv_id":"2404.07413","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07413","snapshot_observed_at":"2026-07-04T20:00:09.029732Z","title":"Jetmoe: Reaching llama2 performance with 0.1 m dollars","venue":null,"work_id":"caed552a-daf7-4ffb-8c36-b989b79c1702","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2404.07413","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a655b14f47901d9b3ef87b1a652713670cc2e21ceae149ad3d3ba0f6954974d9","observation_id":"9db86f0c-b663-41c0-94b8-a06e1f43af34","resolution":{"observed_at":"2026-05-20T22:39:10.975946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-07-06T13:40:19.948018Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":"2208.04933","doi":"10.48550/arxiv.2208.04933","metadata_source":"pith","pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simplified State Space Layers for Sequence Modeling","venue":"cs.LG","work_id":"d4f90830-6ceb-4c9e-b206-eb32ac063f45","year":2022},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:726cf63a5023acdff105868cf919a2e1c3b1025f2f0186958b75c0d0363b52ee","observation_id":"ebeb6227-9c2d-478b-b7a5-1d381f7f72dd","resolution":{"observed_at":"2026-05-20T22:39:10.969061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:1a1b673ceb55048d20a41acd228f4e1b9368141af019c976a5d5090d0cd151fe","observation_id":"d6746456-1a6b-4a34-ba52-d3cc78acd95c","resolution":{"observed_at":"2026-05-20T22:39:10.997266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequence to sequence learning with neural networks.Advances in neural information processing systems, 27","venue":null,"work_id":"1b733364-3418-47fe-bcbc-31297c296eb7","year":2014},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:6999ef639c2d40781da22f8f8a455bb062aa7d46f458bbf3884aae1e67d465bc","observation_id":"d5e3de93-eb54-40b9-9173-757be0431f15","resolution":{"observed_at":"2026-05-20T22:54:11.383901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:ae1636cfc2cf0747f249e9c61e42cbe9f1e53019e588f48f3fcdbb43752005c7","observation_id":"cb53f748-1269-425b-975c-75dcb193c036","resolution":{"observed_at":"2026-05-20T22:39:10.871268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:844a8ca70d092bf370f4f61233e7f285dedf83b5e5cdb23849c5cf1d3a8f75d0","observation_id":"952ccb53-69f2-43d9-a6c4-4079a02d0cc9","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A rank-invariant method of linear and polynomial regression analysis.Indagationes mathematicae, 12(85):173","venue":null,"work_id":"5dc965f9-c8ca-4afe-9560-c30471420be3","year":1950},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:802b058815b66296403a30557806f9ecd5d80b39d4eb6cc119a456feec04bc40","observation_id":"1cbba18b-3e12-482b-8d73-703075019f0e","resolution":{"observed_at":"2026-05-20T22:54:11.392418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logistic regression: relating patient characteristics to outcomes.Jama, 316(5):533–534","venue":null,"work_id":"86ba4dfc-705f-4378-bf5e-06a2f6a36b30","year":2016},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:2a1748f66c49a6fda91ef16c8beb433d0f520c05ff8bcd0bb0afb7f4b5ab8444","observation_id":"67fe9d9d-fa6a-437d-b6e3-d15402c30ed6","resolution":{"observed_at":"2026-05-20T22:54:11.201821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:03:29.365950Z","title":"Mlp- mixer: An all-mlp architecture for vision.Advances in neural information processing systems, 34:24261–24272","venue":null,"work_id":"b597253b-ab65-4477-978d-6d0dfaa6b2e2","year":2021},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:8a4cdbfa292da60ee261d11ab106c1c11f60dc7d81b3154716cb9a5470f00f6c","observation_id":"1a7e072c-d18a-4830-88f4-217d31dbe3b1","resolution":{"observed_at":"2026-05-20T22:54:11.435888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.567466Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"751efe07-5e91-415c-b3d1-f4734aa26960","year":2017},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:e5324f015b9ac7d0db7f0dd9015277e8af575b2778d452aaee9f07fa79b71db5","observation_id":"b8dfbc3f-ffd8-43a6-b3fc-23fdfdd79d09","resolution":{"observed_at":"2026-05-20T22:54:11.178539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.935034Z","title":"Deepnet: Scaling transformers to 1,000 layers.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(10):6761–6774","venue":null,"work_id":"3c8453ee-f1ea-4b94-8b20-0677c197e283","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:201d5efb3d5f01ebd3339b743180673be25f58f52d72782cbadb1b9946bef740","observation_id":"352d925d-2289-4644-8ee0-88a4866d2f6b","resolution":{"observed_at":"2026-05-20T22:54:11.404380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smooth regression analysis.Sankhy¯ a: The Indian Journal of Statistics, Series A, pages 359–372","venue":null,"work_id":"3316d7fe-221d-4c0b-b7a9-8f4e8662bf14","year":1964},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:1b9c0fd94ae937285cc1a0d48c5b8da97071c124baf3222b4ef6d94b3ca8b00a","observation_id":"e2e83dab-d4e8-4aab-bdf6-e35a6072ba2d","resolution":{"observed_at":"2026-05-20T22:54:11.245460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06563","last_updated":"2024-06-03T03:58:41Z","snapshot_observed_at":"2026-08-10T10:34:21.857557Z","submitted_at":"2024-06-03T03:58:41Z","title":"Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2406.06563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06563","snapshot_observed_at":"2026-07-04T20:00:09.047211Z","title":"Skywork-moe: A deep dive into training techniques for mixture-of-experts language models","venue":null,"work_id":"10e04da9-d662-49e0-a54b-e38c50d4a175","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2406.06563","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:bc52d4bae7515c57bc968dd6968bd6f2974e390e92276f6dbc576f129658e120","observation_id":"8f8df168-f0c3-4042-bdab-f7d9e1aa6e96","resolution":{"observed_at":"2026-05-20T22:39:10.948948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liu, and Matt Gardner","venue":null,"work_id":"b7d3d845-0122-422d-93d2-37f743d47d75","year":2017},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:c0457eb368f861a11e371fb860482b7b2866db1fb5435a21bffcc4cef0eac916","observation_id":"32e68478-eb56-4032-8d4e-74b1f762345b","resolution":{"observed_at":"2026-05-20T22:54:11.349730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20120","last_updated":"2025-03-26T00:00:53Z","snapshot_observed_at":"2026-08-07T16:37:00.403578Z","submitted_at":"2025-03-26T00:00:53Z","title":"On the Robustness of Kernel Ridge Regression Using the Cauchy Loss Function","version":1},"cited_work":{"arxiv_id":"2503.20120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20120","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the robustness of kernel ridge regression using the cauchy loss function","venue":null,"work_id":"ff714cdb-317a-42d2-af71-0857b562ce4e","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2503.20120","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:ddbd57e31034263ace94a5b0da4a8af3443ad39159813fc29f7809cc86f5e1a0","observation_id":"3d90216d-44cd-4480-b360-b45ee303d573","resolution":{"observed_at":"2026-05-20T22:39:10.901406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussian processes for regression.Advances in neural information processing systems, 8","venue":null,"work_id":"405ac849-985d-4e62-a099-feb5eb465f5b","year":1995},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:09ca93f2a2cfaedc2efdb26c3992f4d1948af40e695f65e8261ca218194c3185","observation_id":"f634dbee-fb28-4121-b038-777a0fc80738","resolution":{"observed_at":"2026-05-20T22:54:11.221717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08586","last_updated":"2023-10-17T00:12:20Z","snapshot_observed_at":"2026-08-10T19:17:37.263732Z","submitted_at":"2023-09-15T17:43:40Z","title":"Replacing softmax with ReLU in Vision Transformers","version":2},"cited_work":{"arxiv_id":"2309.08586","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.08586","snapshot_observed_at":"2026-07-02T21:17:24.585879Z","title":"Replacing softmax with relu in vision transformers","venue":null,"work_id":"f6dc51df-8755-4305-af50-5508cf496f70","year":2023},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2309.08586","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:7d8a4f32fb30f11e5b4e6a30ec36ed6ff9ff49774d24ef94b21663fa986dc840","observation_id":"54e895b0-6801-4a01-87a6-df709161e991","resolution":{"observed_at":"2026-05-20T22:39:10.962423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24880","last_updated":"2026-01-05T16:51:18Z","snapshot_observed_at":"2026-08-03T01:54:33.526522Z","submitted_at":"2025-12-31T14:16:26Z","title":"mHC: Manifold-Constrained Hyper-Connections","version":2},"cited_work":{"arxiv_id":"2512.24880","doi":"10.48550/arxiv.2512.24880","metadata_source":"pith","pith_arxiv_id":"2512.24880","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mHC: Manifold-Constrained Hyper-Connections","venue":"cs.CL","work_id":"33e3e022-8d5c-426f-8a95-6e7124e202db","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2512.24880","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:3b6f1fbe090264a76a335123bba9bc52b3916db1d6718f989e473c79513515a5","observation_id":"e43b6a37-a611-4b71-8116-cea945a3f584","resolution":{"observed_at":"2026-05-20T22:39:10.937054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.654247+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.654247+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and improving layer normalization.Advances in neural information processing systems, 32","venue":null,"work_id":"f915e60c-4e57-46e4-ae11-1e0e06a2cf10","year":2019},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:21f65f6aafb7891883ef204049e389493d5b19961362b0107e7b6df8f4a18799","observation_id":"9080210a-ffbe-41d8-8c8a-9ff953fa547d","resolution":{"observed_at":"2026-05-20T22:54:11.311378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deltaformer: Unlock the state space of transformer","venue":null,"work_id":"89bb0bbb-5a76-4b7e-b459-38414afe918c","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:ea4edf9f9657cb9967140c54ca95c069809ece149143a4afec41f037b7f6cf0e","observation_id":"03006b32-27e3-472b-bc61-cc3e4ef2366f","resolution":{"observed_at":"2026-05-20T22:54:11.427098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-12T08:17:33.516845Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":"2412.06464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-07-10T21:57:39.161066Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":"cs.CL","work_id":"884939d3-e283-4625-bff4-b7e0e4cc2a6e","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:ec8c376d8d8045e3cd2263df2514ab28d62f689f51ecb8f4d7874f5c9baa3be3","observation_id":"766af756-d052-4823-b303-541d8a7cb09d","resolution":{"observed_at":"2026-05-20T22:39:10.916537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semiparametric models for longitudinal data with application to cd4 cell numbers in hiv seroconverters.Biometrics, pages 689–699","venue":null,"work_id":"612b3ef7-cb91-4cca-9a3e-ad500c6c12c1","year":1994},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:2ccffc6818f173ef53e860b803475f4a77e6e0065f594eb31c20fbe7b2fea45d","observation_id":"e99e3dc2-0bbc-401e-a7da-2be6e3d3c398","resolution":{"observed_at":"2026-05-20T22:54:11.254492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c886c554-b8a9-4a58-8c5a-1bbd4c9cc93b","year":2019},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:51ee42aefeec8a5ffde95469ae7342b93b84fb56ce16f2f34e92da5366b8c8ee","observation_id":"ff9d1fb7-b61f-47ba-af44-83ef23c72749","resolution":{"observed_at":"2026-05-20T22:54:11.298581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:12:38.243273Z","title":"Root mean square layer normalization.Advances in neural information processing systems, 32","venue":null,"work_id":"86716eec-9606-4332-83ee-a0b92b4ffa7d","year":2019},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:263fc66af4649ef8fa28dc2a3b7c94234e670e0b3e75bec0eee7c9b12fd0106c","observation_id":"fdc9e446-71af-4b62-8c99-262cff4578e6","resolution":{"observed_at":"2026-05-20T22:54:11.236851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.06425","doi":"10.48550/arxiv.2501.06425","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor product attention is all you need","venue":"arXiv (Cornell University)","work_id":"60fbb8cc-6d9a-417e-82e2-16b0fdfae5b5","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a6bd10f28901d03f8aa1a0eebfdb99261a100c57d99005115c7271f79e0362cd","observation_id":"57b2f63f-ef2b-44c6-8156-6769f954d6da","resolution":{"observed_at":"2026-05-20T22:39:10.909381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:49:50.520388+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:49:50.520388+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the mixture-of- experts with nadaraya-watson kernel","venue":null,"work_id":"5bfcc465-f31c-43f4-b7c5-36eb3a9f9fd3","year":2026},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:60e7c34bcecd37bd8bfbb05baa7893e8999d0a79e0bdbc564813e87ea60c2d91","observation_id":"f1753e26-6a93-4c92-ac4e-ffd41425cd67","resolution":{"observed_at":"2026-05-20T22:54:11.286590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19606","last_updated":"2025-03-18T10:12:54Z","snapshot_observed_at":"2026-08-12T22:35:14.163331Z","submitted_at":"2024-09-29T07:57:07Z","title":"Hyper-Connections","version":3},"cited_work":{"arxiv_id":"2409.19606","doi":"10.48550/arxiv.2409.19606","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.19606","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hyper-Connections","venue":"arXiv (Cornell University)","work_id":"6cfc7245-c5ef-4350-8cb4-4857c9019ca2","year":2024},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2409.19606","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:3a16f3a373b3aaffd318bfa328c6b2807162e4186c9c702ef10847b39953c2ab","observation_id":"45e32308-178d-4820-8ba3-a45d1ad62925","resolution":{"observed_at":"2026-05-20T22:39:10.887046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:26.304381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:26.304381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In matrix form: Z LLR,(h) =S (h)V (h),whereS (h) =e ⊤ 1 X ⊤ i WiXi −1 X ⊤ i Wi,(15) with Xi = [1 , (xj −x i)N j=1]the design matrix and Wi = diag(K (h) i1","venue":null,"work_id":"2c017920-a6f0-491a-9e88-f16081964d0b","year":2048},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:d035fd31d38473d3048ecee33823bb415254e07d33df4c5651aedcb89061898c","observation_id":"96a57284-24d4-4743-9006-30ebf982b81f","resolution":{"observed_at":"2026-05-20T22:54:11.334272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":27,"verified_fuzzy":69},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2605.06501."}