{"as_of":"2026-08-04T10:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7faf2079949b9cb12a38b9ee79656f2ce00129f0fe0e3abf516b0a39ac9affe5","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:14:01.584159Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:03:22.318771Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08301","snapshot_observed_at":"2026-08-02T06:39:20.915609Z","title":"Priming: Hybrid state space models from pre-trained transformers.arXiv preprint arXiv:2605.08301, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-04T10:22:21.023148Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:39:20.915609Z"},"links":{"cited_paper":"/paper/2605.08301","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:820cccac829c69f28679f18a037fc58a9523c3d1e3626b247149866f5b81512d","observation_id":"6e95951f-c6f1-41fe-b0cd-289351c35abe","resolution":{"observed_at":"2026-08-02T06:39:20.915609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08301","snapshot_observed_at":"2026-08-03T02:03:22.318771Z","title":"Priming: Hybrid state space models from pre-trained transformers.arXiv preprint arXiv:2605.08301, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-04T10:22:21.023148Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:22.318771Z"},"links":{"cited_paper":"/paper/2605.08301","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:bade1101f920bcd1bf31d39e3ecaf3843cf713fbeb4111d91b09171aaa889d57","observation_id":"7241869c-1acf-401b-a44d-95865c955a0c","resolution":{"observed_at":"2026-08-03T02:03:22.318771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08301","snapshot_observed_at":"2026-08-01T02:37:54.395898Z","title":"Priming: Hybrid state space models from pre-trained transformers,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-01T14:23:07.610419Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.395898Z"},"links":{"cited_paper":"/paper/2605.08301","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:63835fc0de40dd801ec4da14c63c32b22a7b877295c939729c54d6403179d60e","observation_id":"8d8a1feb-65df-46c1-ba5e-724df7bd875e","resolution":{"observed_at":"2026-08-01T02:37:54.395898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.08301/citation-record","integrity":"/paper/2605.08301/integrity","json":"/paper/2605.08301/citation-record.json","paper":"/paper/2605.08301"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.298","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:17:23.565050Z","title":"GQA : Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"eadb5933-87f2-4102-94c8-52fe2ccbc1e2","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:c9c0d0d3580ced57c2da9ab18fee7f37ccc26b17e56d88b7a414fda762d9f162","observation_id":"5ff7aafc-a2be-45bc-bef2-5cb6822ee13b","resolution":{"observed_at":"2026-05-12T01:16:13.883063Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:40.00604+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:40.00604+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training-free long-context scaling of large language models","venue":null,"work_id":"f5dd2b39-7ec8-4a2c-a48e-88f191d30f23","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:2e18c1fbae3b984307b479a11aba8ad5186b79910cb1267c04f74646bedcd957","observation_id":"51e8d96c-ee7e-4d16-a986-214fc6daf6c7","resolution":{"observed_at":"2026-05-14T08:05:37.628756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"d26b4c79-44b2-4707-beec-e8bbb591bfc5","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:48f99a936e9432ac27c37f1026f6ea15b478774504eb173735ee2c4a3aa519bf","observation_id":"b5a230cb-4f44-423f-bf26-dde20eb946b5","resolution":{"observed_at":"2026-05-14T08:05:37.623082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-02T20:03:37.497118Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"cited_work":{"arxiv_id":"2510.04800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.04800","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","venue":"cs.CL","work_id":"dbe26216-99a0-4ca6-982a-2bdb8da9f505","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2510.04800","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:774954c5675ef662bd4faa37a7fe8fcf13d558018461ee9f7e593fc4946ca8b6","observation_id":"d32423a0-737b-4ff9-9aa2-8ef27a780df7","resolution":{"observed_at":"2026-05-12T08:21:24.319329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/1.9781611971538","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chan, James Demmel, June Donato, Jack Dongarra, Victor Eijkhout, Roldan Pozo, Charles Romine, and Henk van der Vorst","venue":null,"work_id":"5fa8e328-c640-4e76-bbe9-855d23a14ee9","year":1994},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:12d2a3cbe98f033c5b1f63b5e5efb4b738b0181e51017e049d01dff8350a39f4","observation_id":"937d8321-0e24-474d-b17f-f5c9de20b1f2","resolution":{"observed_at":"2026-05-12T01:16:13.855279Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T22:20:14.576992+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T22:20:14.576992+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14444","last_updated":"2025-09-02T16:12:36Z","snapshot_observed_at":"2026-07-06T22:15:27.120497Z","submitted_at":"2025-08-20T06:00:57Z","title":"NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model","version":4},"cited_work":{"arxiv_id":"2508.14444","doi":"10.48550/arxiv.2508.14444","metadata_source":"pith","pith_arxiv_id":"2508.14444","snapshot_observed_at":"2026-07-11T03:07:51.264863Z","title":"NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model","venue":"cs.CL","work_id":"a449edca-bc6c-4333-9b98-84c9578290bf","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2508.14444","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:eea981bc45babf6702785470a61b52579401d7b57d6cff84de18377e020d205e","observation_id":"6f681267-1086-4cd4-bc16-65167b3d0426","resolution":{"observed_at":"2026-05-18T11:02:08.433616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:36.116713+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:36.116713+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"o ppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, G \\","venue":null,"work_id":"1ec74ad7-2d59-452c-9c96-9c9986b7c214","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:1a6da9db135d074300fa6bf5f08db8c3e9e366b6a80a70a5f6cc1105fb0c9619","observation_id":"bfc6085b-37c1-430f-a58a-b651690c2097","resolution":{"observed_at":"2026-05-14T08:05:37.624776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers to ssms: Distilling quadratic knowledge to subquadratic models","venue":null,"work_id":"c5ea7687-a8b7-49df-8f94-f8ac9c04d33a","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:d8771be49e7a086bdfc9775b1a03b83e3ffbf7c5d60c3ab33062fd8ed3e0f584","observation_id":"0cb57d44-57fe-44b8-bfb0-692de7f97051","resolution":{"observed_at":"2026-05-14T08:05:37.619608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"cited_work":{"arxiv_id":"2512.20856","doi":"10.48550/arxiv.2512.20856","metadata_source":"pith","pith_arxiv_id":"2512.20856","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","venue":"cs.CL","work_id":"58d1532f-1164-4b9a-a02a-e1f826067ac2","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2512.20856","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:301d033938e7c12f0ac920bcfbe3eddadf9aca9cf5c1a64ec33da9a3954ca72b","observation_id":"81eea1c2-39bc-401c-bff5-fbec4135112c","resolution":{"observed_at":"2026-05-18T01:40:43.189893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20848","doi":"10.48550/arxiv.2512.20848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Nemotron 3 nano: Open, efficient mixture-of- experts hybrid mamba-transformer model for agentic reasoning","venue":null,"work_id":"b24976e1-fa33-4e70-8966-6c5c6d7ba8ef","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:eb52c063bc36bc28551cd90b8d378868d6cb09fdda1b00794497894b62e8322d","observation_id":"b9810ab0-561f-44cc-be02-b1746864dd73","resolution":{"observed_at":"2026-05-12T08:21:24.383814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T09:20:17.14508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T09:20:17.14508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00729","last_updated":"2026-02-28T16:25:04Z","snapshot_observed_at":"2026-07-06T22:47:24.369805Z","submitted_at":"2026-02-28T16:25:04Z","title":"Qwen3-Coder-Next Technical Report","version":1},"cited_work":{"arxiv_id":"2603.00729","doi":"10.48550/arxiv.2603.00729","metadata_source":"pith","pith_arxiv_id":"2603.00729","snapshot_observed_at":"2026-07-10T13:57:06.835497Z","title":"Qwen3-Coder-Next Technical Report","venue":"cs.CL","work_id":"ad966e68-641d-4b33-a9da-57cf741f35a6","year":2026},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2603.00729","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:01fc875a9fb4d2a89bbee31a39e6c6d23bdc28f54f8aed3df78bb2880bf8d836","observation_id":"5d2e8985-7c82-48f3-9dfd-757aa98d9d5e","resolution":{"observed_at":"2026-05-16T21:12:48.468873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:4fab0c24a1de6a2db4a7878d3f31c488fcb0cebaea765dcf7c3144537d68e51f","observation_id":"73390f12-bb59-4489-a813-743d78cc460c","resolution":{"observed_at":"2026-05-12T09:28:16.586976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:aa815f7d51efeb12ba3026f0b0233af3dbb1a5fa87e945298d2abe8c286ab769","observation_id":"d60bf531-4344-49c9-921a-7ce4e222f91f","resolution":{"observed_at":"2026-05-12T08:21:24.324208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":"a7a116cf-c420-4393-a671-0ccf6b82eb79","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:c922b5e36854242dacec3001bb29f655ffb29a747219b6db8ce0180d0ba5457b","observation_id":"017c088b-7c25-41f6-81e3-d757de190138","resolution":{"observed_at":"2026-05-14T08:05:37.617611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:4ec51f28da4acdbdf278d2ef2214ba2bfe5082077ce0924d4999c7176549c7d2","observation_id":"3020041d-d596-407a-8758-7b23be2f8263","resolution":{"observed_at":"2026-05-12T08:21:24.428564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Albert, Pranesh Srinivasan, Haining Pan, Philippe Faist, Brian A Rohr, Michael J","venue":null,"work_id":"556a1e65-fe74-4ff0-8bf2-c9cc2e4ec313","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:eefc125f08ea3f9405ba6af61422281287de8aed2fd8186e11b641ea3184ba10","observation_id":"7e8955e8-2cc8-4860-8c1b-c175cfb36fbe","resolution":{"observed_at":"2026-05-14T08:05:37.621362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context","venue":null,"work_id":"46aa5906-6d55-4a6a-9a48-2604bcc755ca","year":2019},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:ad244b5c3d5ed13e5c41d1ec1c2da99bc0535facee780d89bdac3c0872e0fb2c","observation_id":"a78944fe-cdae-49a4-9fc0-fb2af640fb0c","resolution":{"observed_at":"2026-05-14T08:05:37.626741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"6c8dbebb-54c8-4efa-ae6f-7079b81eb645","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:52cee3ff4a39cfc9a452cc8838d60e346f5c7fb0ce0ec89c6508f490206f9234","observation_id":"bd33fdd7-d439-45d6-a3c7-359a5313b4ca","resolution":{"observed_at":"2026-05-14T08:05:37.630680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"c5825fb7-f765-4263-b9b4-2242b71b38bf","year":2022},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:48a6ceb2273f31eac59d98fd09f990fb117ce41d0e2db209afc501cac5b9d734","observation_id":"01c2b27f-cbdc-4fdc-bcb6-ca9670a9df3c","resolution":{"observed_at":"2026-05-14T08:05:37.610375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:64a6848321103b8993886b9d158385b5b4e0d2a6051b29104c2a8781ea85f67d","observation_id":"96e8e322-c921-43a0-b314-a6df5715f1a1","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fewer truncations improve language modeling","venue":null,"work_id":"c74aff51-66d4-4016-b981-f79cc5b7ee76","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:560737f503ad2d9d511e2fbb3741a9c09f2db1a18f6d837fb46664326ca78209","observation_id":"b3df9085-4f0a-4da3-9d68-d551fe8ab05c","resolution":{"observed_at":"2026-05-14T08:05:37.608426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hymba: A hybrid-head architecture for small language models","venue":null,"work_id":"2936d287-0583-468c-9083-4f97dfabd787","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:59c9c9f82f9ff597ef3f769704ced6691db4512eab7e9f6285629aa88df6f704","observation_id":"363e801b-12a3-4f15-b0e3-bfc658e1c6b7","resolution":{"observed_at":"2026-05-14T08:05:37.612412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":"75edbc80-775a-48bc-aeb3-ce956ba824bb","year":2021},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:6bb61ee4afecff14cc82d5d2963071a3c2ca912f6a4706e96579b0f005b6abbb","observation_id":"279ab5d2-cf54-4277-b35d-d2a7da0b70c5","resolution":{"observed_at":"2026-05-14T08:05:37.614239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AREAL : A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":"981f613c-0002-4c07-83e8-aaa2aaf28766","year":2026},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:b9393fdfdc82e7d56bac2573c5a6faf074718c6ad743d1c9c10d1c9c3e69a390","observation_id":"3cf975c1-395e-4bc3-9f16-7eedb95fba61","resolution":{"observed_at":"2026-05-14T08:05:37.603176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12167","doi":"10.48550/arxiv.2512.12167","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2512.12167 (2025) 44","venue":null,"work_id":"e03b7190-a790-40d2-9e41-df7dbc35cb34","year":2021},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:33234a5a8a52ca0c6c31f4116741cff2ec66dfbf28715b36d73fe04adb415090","observation_id":"426662d7-f5b7-4f1d-bd8b-15a064ad7429","resolution":{"observed_at":"2026-05-12T08:21:24.341764Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-07-06T18:20:14.021759Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":"2405.16712","doi":"10.48550/arxiv.2405.16712","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Zamba: A compact 7B SSM hybrid model","venue":null,"work_id":"042a830e-b7c4-4954-bd51-2f8c14ef9fa5","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:3b24d154b60001dfe0d9d089ce4a59cacedee200c41a4cff36e78cc7d7671bbf","observation_id":"1cabd8dc-b39d-40ab-81f7-05a3ffbb71d6","resolution":{"observed_at":"2026-05-12T08:21:24.308739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RADLADS : Rapid attention distillation to linear attention decoders at scale","venue":null,"work_id":"e828b778-5baf-4680-a84e-4b84f8b97b22","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:ce022f41823ebce84a7700433db24c07ae5f44bee2f4556093bb69d41bc84b4f","observation_id":"ce0bfaac-6b8b-4da5-921e-5945e98fe755","resolution":{"observed_at":"2026-05-14T08:05:37.605008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:3b8577d4378110c3c00545086626c97aa3ad29a8fcbe8e9c9df64e401d2f11ca","observation_id":"f20a10db-f0f4-42aa-ac4f-4b9203b03277","resolution":{"observed_at":"2026-05-12T08:21:24.292006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-10T20:07:33.480124Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:9cf09e810da39b6d5dc216ce4482c67fb2ecce3ba0ad8bd6f8fa9266713204e4","observation_id":"6ff6264f-8d7a-43a0-afb5-fd5dddbf66dd","resolution":{"observed_at":"2026-05-12T08:21:24.314225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers","venue":null,"work_id":"9d11e010-2414-4c09-8251-4b1f6e168a34","year":2021},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:f05bfce27e49890390fb0487260b12b1130a5d3b4e4393349461ebcec4c263fa","observation_id":"281c1068-8fdb-4e87-819f-1a4ac6d0763f","resolution":{"observed_at":"2026-05-14T08:05:37.615947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"3443090a-cb8f-46d3-9dc8-9bfb26b598d5","year":2022},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:366506df565fa9a6c2fb22cea6a9e0a60b5592cb454a76e03406650742c36f07","observation_id":"e531da0d-4253-4a6d-bc90-599e5a9b4b53","resolution":{"observed_at":"2026-05-14T08:05:37.632757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jet-nemotron: Efficient language model with post neural architecture search","venue":null,"work_id":"e1f322b3-f77e-42bc-9f2b-23f34c0bdb77","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:835e66f552b8df3a8df4d2956e76ccd1da91364bc0d784311b640528ac44459f","observation_id":"16c30fae-2d50-47a4-baec-22e9372604a0","resolution":{"observed_at":"2026-05-14T08:05:37.634462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of model reduction by balanced truncation and some new results","venue":null,"work_id":"8269f1ad-cf34-4c60-a508-a7646a65d66d","year":2004},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:2cee1db21c1c9f4b444ee80dfcb25fc00f5c407d401da978a39746ce8ff5aeae","observation_id":"3bf65d22-8989-4c53-97ea-5578daaa2961","resolution":{"observed_at":"2026-05-14T08:05:37.599732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:37:20.675521Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"42c395e2-9c11-4300-9b02-bf1da5b5606b","year":2021},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:fd38f5c04474d6f3aaa5e3e0b889c8971af5079f7a079bf4463a9cd5ce9d126c","observation_id":"8c850831-affb-47d6-bb81-6e593771b881","resolution":{"observed_at":"2026-05-14T08:05:37.593886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RULER : What s the real context size of your long-context language models? In First Conference on Language Modeling","venue":null,"work_id":"0dfa4c43-8796-4f0a-8d3d-ae610c0a87f5","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:6033c61a497ac123e84a184cdc4158982a171ae70b8bd04f9ef53ec454f29ad1","observation_id":"f8cf7fb8-eb70-48aa-8284-7c31f7af2c0f","resolution":{"observed_at":"2026-05-14T08:05:37.601514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-07-06T16:23:34.422580Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:c6afe5405a4b3b8145a6b2f4bc7e7315b32363d8c5780182fa8fe602da691df0","observation_id":"1ae39118-3125-4b44-8c67-34f172dcf609","resolution":{"observed_at":"2026-05-13T01:07:22.650116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"56eb9273-dffe-4927-98f2-16a5531cbaec","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:c39b6d06bee3b874a119bf8e3aeeb508a670ca17fa959127e18f9c897f605de7","observation_id":"c30619b5-d517-4600-96a3-288bb4aaf694","resolution":{"observed_at":"2026-05-14T08:05:37.586669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kakade, and eran malach","venue":null,"work_id":"f9f8bb8c-7ed1-4352-9fbf-909767d077f9","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:8534ab096df6730af84d74a1fb227aa05657123b547e81a71aef8e7d0d1da94c","observation_id":"e2ef0674-9eb1-41a4-aeda-305953802a16","resolution":{"observed_at":"2026-05-14T08:05:37.606603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SWE -bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations","venue":null,"work_id":"cbf90a07-0adc-4864-9a27-518b007cbc44","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:f9d4ff567d27509bb8651a495670c2942516801ffe7b576d9503500792a7c899","observation_id":"47c771e0-f2e4-4a40-bd43-0864906837c8","resolution":{"observed_at":"2026-05-14T08:05:37.581759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9bb24461-e21c-4119-92fb-0bdbe12d6597","year":1960},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:e0e6430bb88e82f47424848812d2554e537666bacfabb044ce52de9e01916baf","observation_id":"490f224e-a9ff-4fa4-88b5-de3383575342","resolution":{"observed_at":"2026-05-14T08:05:37.583305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"ccfa525a-860e-4b33-afa9-411f0735de8f","year":2020},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:b021ff0fb26849d1a3f524b129d218cf81450f0679f626352980dc539e0115fc","observation_id":"2e58b95e-be58-4d01-9c25-cfc01b0401a0","resolution":{"observed_at":"2026-05-14T08:05:37.584966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"512054d4-e638-4357-b9c1-e9e7be54c59e","year":2020},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:f268036b0fa8b7f02465bc2390b2ed0b403db4c760c8a457ab1bcc4032c5029a","observation_id":"3a2a1bfb-6e45-4952-a779-28f2d39b268f","resolution":{"observed_at":"2026-05-14T08:05:37.588437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BABIL ong: Testing the limits of LLM s with long context reasoning-in-a-haystack","venue":null,"work_id":"b1d7195d-2473-4c8c-8047-ff5dc7b1b87a","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:6796bd673bfeb6f94e2e7342618c0ee9c15cf397e18e10f1240dc6a48166f23f","observation_id":"47bb123b-44ac-4f48-944c-bf5a5a20f7b3","resolution":{"observed_at":"2026-05-14T08:05:37.591885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"52a458b7-066f-4f6a-87b2-1bfa236cde69","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:6d4df2e0c5a174273ad63f46f41b5ea699fb7d3f25c0fa2630810ce91808be8c","observation_id":"aea44e9c-66a0-4197-a0ae-7236307006a8","resolution":{"observed_at":"2026-05-14T08:05:37.596001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Christopher Wilhelm, Luca Soldaini, Noah A","venue":null,"work_id":"7ad15fb4-8f36-47f6-8601-12e8c6b676d1","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:2952c4a90694fdd1a1b7fc7c8ec531072e4855ca8f7f459e4c0dd9a4fb3ca87b","observation_id":"f8e55d16-425b-49ef-8448-f5994b95eb4e","resolution":{"observed_at":"2026-05-14T08:05:37.590105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liger: Linearizing large language models to gated recurrent structures","venue":null,"work_id":"a71cb4cb-4083-487b-b2a5-108e6615ebf4","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:ad6fec99ee90bf525418dd11e31e12d35c04e0d70abe1be97169ca6bf95c3033","observation_id":"988de457-b21d-4390-a0c1-2fa629a902f9","resolution":{"observed_at":"2026-05-14T08:05:37.579760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:37:40.375063Z","title":"Distilling to hybrid attention models via kl-guided layer selection","venue":null,"work_id":"699c93e0-d1e0-4282-8c63-305282792cd3","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:2185e3058d5b001f665d5446d33d052a16e178431dc5494bc509d04ff8d6e262","observation_id":"28d1534a-5c58-4db3-ac42-84b8dc67bb81","resolution":{"observed_at":"2026-05-12T08:21:24.433997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":"2403.19887","doi":"10.48550/arxiv.2403.19887","metadata_source":"pith","pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","venue":"cs.CL","work_id":"129df0fe-8a66-4077-8991-3557cfa38274","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:45fe7e54be4e2649b3dfadc41bf841f22c63d3eebca1bd122ed1b4629cd52825","observation_id":"a00fa614-b8a5-4108-a1d7-86958c0cce91","resolution":{"observed_at":"2026-05-13T14:11:27.316872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":"7536ebb9-0c17-49ab-91be-225c66878f76","year":2022},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:cc3251ba7d69f921d3fb83d1ab6d16d63231fdcaf2ea3062683eba40f659ee26","observation_id":"49ceeb95-dd09-4998-8c1a-9b81a21cbe86","resolution":{"observed_at":"2026-05-14T08:05:37.569193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the stochastic realization problem","venue":null,"work_id":"93a78f74-d814-4ca6-92e5-5b7c07aca26e","year":1979},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:2116c2e9afe4827c21169410a2ef728dbcdefa0bc50b3f77046f4ca037b6bbae","observation_id":"5b1386f6-2a5e-4c76-bd15-7c542f625b06","resolution":{"observed_at":"2026-05-14T08:05:37.570902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ringattention with blockwise transformers for near-infinite context","venue":null,"work_id":"3551b681-d45a-4e31-b780-45912601668a","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:bce2f3f371b200af24b5c6d3ba73120476cf9c250fb41bad858c2a395e299e0f","observation_id":"d8b7613b-0b3d-4d70-beda-a375c2958f6a","resolution":{"observed_at":"2026-05-14T08:05:37.572567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"2b581c40-f898-4013-8db2-0565d6091397","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:95798967a06e090ca2223f4280d04460445388b92540bc90cf829c8dfc80a2e9","observation_id":"5188ea24-2971-405a-a5f6-d4d51d710546","resolution":{"observed_at":"2026-05-14T08:05:37.574274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PICASO : Permutation-invariant context composition with state space models","venue":null,"work_id":"fea7ac39-8bdf-45b7-b580-6c51b473d26b","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:97c15c60da4e0143e2b9ae229de162e3c6726976b7fc72cd3c328e1faccc04b7","observation_id":"161b96d5-0ac4-425c-8728-ed406cbc5ae8","resolution":{"observed_at":"2026-05-14T08:05:37.563820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9deb778-7de5-496b-939e-d5dc11e8aa69","year":1999},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:ce0e9d69f14e509577d8412de865301693a98f8ef8f3b09e16d5ebb9966327ea","observation_id":"565abb02-4b3a-4a55-8172-2a0bf9caab66","resolution":{"observed_at":"2026-05-14T08:05:37.565525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/0005-1098(85)90110-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error propagation properties of recursive least-squares adaptation algorithms","venue":null,"work_id":"543ec8e8-c3b0-4c44-b86c-bb933644f87b","year":1985},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:e19e9cf13870060f266451fc4b4feb005e51937d7f105440cf55ba82d3d98b27","observation_id":"06284579-59f1-4c7b-9b11-24059eedf42f","resolution":{"observed_at":"2026-05-12T01:16:13.851121Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":"2212.10511","doi":"10.48550/arxiv.2212.10511","metadata_source":"pith","pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","venue":"cs.CL","work_id":"5021c16e-c088-4765-8c10-3d0dd6e18bb0","year":2022},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:0fba2c4b262d632b14939d713f7a500c79854fcf956e570606fd1b3d26ad1910","observation_id":"a4f5633b-649f-4f16-a69d-e599b577a8cd","resolution":{"observed_at":"2026-05-18T11:33:08.656299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AMC/AIME : MAA invitational competitions","venue":null,"work_id":"84f205cb-4964-4fba-8ebd-d777bba7f92a","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:2bc3e66cc7919f1a353bf1a136334b387729199bd570e1aad7d8944af6130182","observation_id":"882de4f2-0ee7-421c-b007-f59a54d3144f","resolution":{"observed_at":"2026-05-14T08:05:37.576248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linearizing large language models","venue":null,"work_id":"a56a4fac-c90b-446b-921e-e32e55f04ef5","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:d92cafd052d1dce4082c07e5c3c1b7fbed1eadaefdf22804dca0ba53e3be09ce","observation_id":"df7df56e-506a-4215-8e78-6fb315c5543d","resolution":{"observed_at":"2026-05-14T08:05:37.560473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Landmark attention: Random-access infinite context length for transformers","venue":null,"work_id":"9a445bf3-0c19-4a83-964e-df70dbeec52d","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:bcbcf734553d9cad482b890fcf432fe3325d2982894264e929546f96c094daa4","observation_id":"f562990e-7dfa-487a-bf7a-e7a8c67249af","resolution":{"observed_at":"2026-05-14T08:05:37.555534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":"2404.07143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-07-10T01:36:44.083287Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","venue":"cs.CL","work_id":"aecc8f73-1fd7-4a39-8ae7-a172b6a435b6","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:b02c1276e0e4c5c4a8ac973e1932540ecafc84299ffa4e8abb2e125fb64a64e4","observation_id":"e83cdf94-e5b8-4fbf-aaaf-6faf1ac9127b","resolution":{"observed_at":"2026-05-21T18:17:00.308428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"17e7e8e0-953c-4964-be77-6e20b234d6f0","year":1998},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:640e393f9d13ec5b59b5d51d27248d069fe24cba1ea1b09577852ab690ff5a0b","observation_id":"3c0df41a-7846-4aab-9c6f-176c801b3f07","resolution":{"observed_at":"2026-05-14T08:05:37.557174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expansion span: Combining fading memory and retrieval in hybrid state space models","venue":null,"work_id":"e18381b1-5dfc-4a5e-9e28-95bd1766f304","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:7030804a4f263c4719e8fc606377011a7a39605fb8cb2d0362533e5dfe83db8b","observation_id":"60347e00-26d8-4a50-ad55-ce99597ea7b9","resolution":{"observed_at":"2026-05-14T08:05:37.562085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":"2209.11895","doi":"10.1145/3411763.3451760","metadata_source":"pith","pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In-context Learning and Induction Heads","venue":"cs.LG","work_id":"db2b0911-2758-4a2a-99dc-15b14b91bd5e","year":2022},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:e46bbab428f7e9dea98ce9e3b91a2390c37e6d3757acbd16f174f312956425b7","observation_id":"c39bae94-aef0-409d-ac04-5f7881ed9c77","resolution":{"observed_at":"2026-05-12T08:21:24.351717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resurrecting recurrent neural networks for long sequences","venue":null,"work_id":"8d4669df-79e2-43e2-9f95-66fd62c4f004","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:0b37d2ca3b1f5075a4dd82ac43461253b1817daa577fc58f2b11b6117430a038","observation_id":"f5f4758e-6e05-4ffe-8dd6-90b914375b6f","resolution":{"observed_at":"2026-05-14T08:05:37.553782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marconi: Prefix caching for the era of hybrid LLM s","venue":null,"work_id":"5119058e-bdb2-4291-91e4-f80ac84123db","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:d0d5ae7c3cdf347047638a379f9b269187697ac830883a22bf751447b0020f16","observation_id":"aee01451-f1bc-4d82-8a51-f6d9ca9c3f38","resolution":{"observed_at":"2026-05-14T08:05:37.558885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":"928bfb08-c3f0-4302-8d81-9790c91fbdb4","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:a5ff93a5b2ae2c37798ed80179921ac875d2f839c0bd07ff0c8064a05a0f3fad","observation_id":"dcf34717-e677-46d3-8a55-f08bc8ed5e90","resolution":{"observed_at":"2026-05-14T08:05:37.567478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-1-4757-2817-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Time-Varying Systems and Computations","venue":null,"work_id":"efe9240f-e35a-473c-b3c6-1ad04bf90138","year":1998},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:3c45f2366bbc5d5294400c5a660f5730c39eca5e4a5420bcacc98da76731bbee","observation_id":"272b97d0-e517-4bce-a3ea-da3b4cea7187","resolution":{"observed_at":"2026-05-12T01:16:13.867011Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ya RN : Efficient context window extension of large language models","venue":null,"work_id":"cc96fddb-88df-4464-9579-0ee2a63b9486","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:2b3c4ff7c092d037f8c20e406d41df2721974582e7ab18e011e59d4136a95b3c","observation_id":"6436c4c4-57c5-4314-a932-a569b495373c","resolution":{"observed_at":"2026-05-14T08:05:37.597985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"cited_work":{"arxiv_id":"2511.21016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.21016","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated kalmanet: A fading memory layer through test-time ridge regression","venue":null,"work_id":"e7072bff-623f-4832-b92d-d352423ddd46","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2511.21016","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:e6f5b78f84c0f661ff81f6e0f8a251a207a25979dd3887d9544593eec5ce88b6","observation_id":"a8d63189-fa8e-4492-9239-41c59c345cb4","resolution":{"observed_at":"2026-05-20T00:04:17.792158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:24:48.351330Z","title":"Generalizing verifiable instruction following","venue":null,"work_id":"798bc1aa-d1a8-49aa-b39f-5516a39eade2","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:b14b089077e2455a2f68f869da43405ceeb21fa59c8f4dd2d023156f484434c2","observation_id":"9fa358c9-7797-4344-8374-0f00905acf27","resolution":{"observed_at":"2026-05-14T08:05:37.546893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ulysses sequence parallelism in the hugging face ecosystem","venue":null,"work_id":"5d6eea3d-8570-4c57-9ae3-c6b4ce2358b3","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:efd44474da5619914114668e12882ba93d9409d2a961ee6b018eb7a0b500eee2","observation_id":"a5ae0a2e-c954-49b4-9b55-9223e8962699","resolution":{"observed_at":"2026-05-14T08:05:37.548622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:45:12.938750Z","title":null,"venue":null,"work_id":"97525236-1aa0-43c2-9ec5-0d664c1c4656","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:4c121f7b4f9aba4130c542fa493d8d6e2423419978550413d5696dd2b1172e4d","observation_id":"10b9c153-478a-4296-b8cb-82b16c474648","resolution":{"observed_at":"2026-05-14T08:05:37.543131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":"6b6b1569-983f-401a-a1d1-2204d030d855","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:f9d4674d3fc0a56706ea245843fa38c11e092123d6daec71129d7cdc80fa09ec","observation_id":"6a65d74d-56b4-496f-bb0e-1a5633daa46f","resolution":{"observed_at":"2026-05-14T08:05:37.516151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.02782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":null,"work_id":"b498d2b3-0c67-485d-9636-4f9025eebaf0","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:a765121609eb25e990a77bcb20f5eccb2493a648d4b25b05a89833ff0c8d1bda","observation_id":"7ef43862-d7e3-4c5b-9a2e-a8a6ef7afcd8","resolution":{"observed_at":"2026-05-12T08:21:24.329790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2003.822862","doi":"10.1109/tac.2003.822862","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Sandberg and A","venue":null,"work_id":"f30e4dd9-2156-4de4-82cd-88ecf6f933ae","year":2004},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:b5c21c12b4b6a86c3a313b2fc516f53a7684d813934f93064c18c5ed14c2e171","observation_id":"13a2ee2d-c848-4f4c-859d-419c44e8051d","resolution":{"observed_at":"2026-05-12T01:16:13.875977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0cec3609-bb08-4477-b2d4-229dc6ee71aa","year":2003},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:c2d591339bb8f03621047918dccf2b460ce29d87810e76698f0e280d32dca589","observation_id":"9bd85cc4-e5dc-4a41-a84e-71edc2ef8922","resolution":{"observed_at":"2026-05-14T08:05:37.544778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"044e6725-9682-4ea6-af1e-a26fa779ab43","year":2011},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:7002dded366cda3f9a374818fcc5c3ad6803b61de9bf4c1990f7d7486db41472","observation_id":"dee51b14-2b7a-4c12-a90b-8989670958c9","resolution":{"observed_at":"2026-05-14T08:05:37.550215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":"c91c22d2-dfd1-4507-9690-cfa05ae71384","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:54056efa649bb96729be7b360adf4d6a20b7b860c69ec7c076c6870efccbcd29","observation_id":"52ba9a51-c1c8-4f15-b6a8-98bc4b2fce2d","resolution":{"observed_at":"2026-05-14T08:05:37.521493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9031.369607","doi":"10.1145/3689031.3696072","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"4909736c-3fe1-4820-b489-cca51669c6d2","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:fc184005ab39a7a2cc44d97125f57176a03a45452d772195a4a4b4345c7a5422","observation_id":"3b4d2990-9ea2-48e9-9dd1-197840eb6047","resolution":{"observed_at":"2026-05-12T01:16:13.863162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-10T16:37:23.051852Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:beb905976352e18ed44a49466f2492183945fa73c0feabca872595dfc23a18b7","observation_id":"326614f8-3d6d-40da-93d7-9b8f4ef33b72","resolution":{"observed_at":"2026-05-12T08:21:24.303495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"cited_work":{"arxiv_id":"2604.10098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","venue":"cs.LG","work_id":"13fd00a7-48b0-40e3-82a7-8502aef0377c","year":2026},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2604.10098","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:ebe34389adf99f1de505be143d9a72f7560605e7bab4f164a332c40f0340ac4c","observation_id":"8922d645-bb58-49af-94e9-c1af7a027842","resolution":{"observed_at":"2026-05-12T08:21:24.357221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:a1b7f7840ef3c5993531a940221f24877351c86787b41b993ec431897e38b980","observation_id":"ec2e9b3b-4ffb-49a6-8046-950a486a530f","resolution":{"observed_at":"2026-05-12T08:21:24.346538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"ed900cd6-d31f-403a-8451-3ec9a1563beb","year":2023},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:f954e5e001fc76c8d89791d6b43779c99ce0e092fae50aa879d8dc0107bbff33","observation_id":"b68dc4de-f625-4eae-8803-362998f0c8d6","resolution":{"observed_at":"2026-05-14T08:05:37.523437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scicode: A research coding benchmark curated by scientists","venue":null,"work_id":"e07f01ad-bfb5-4575-8959-db729a7aa8b8","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:c99359877234832bc29a9624c6f3d07685a1b63754f5173b91704dce6e2b20d1","observation_id":"82074d65-a63b-463c-be2d-c2229ed33159","resolution":{"observed_at":"2026-05-14T08:05:37.519793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"43dc0a60-8d22-4f0d-896f-1aa83d601b42","year":2017},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:fb9853bea1eefd772fc6312a570ddf0fb88125d0f1a62d4afcb68c9b9b76a500","observation_id":"cb3c5521-07db-497f-b58f-4e30e9442b2d","resolution":{"observed_at":"2026-05-14T08:05:37.518071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12640","last_updated":"2024-09-20T00:47:33Z","snapshot_observed_at":"2026-07-06T19:18:04.618039Z","submitted_at":"2024-09-19T10:38:01Z","title":"Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries","version":2},"cited_work":{"arxiv_id":"2409.12640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12640","snapshot_observed_at":"2026-07-04T10:59:46.622401Z","title":"Vodrahalli, S","venue":null,"work_id":"3fd26bce-a521-4b96-9d09-3471f4b31c57","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2409.12640","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:d5f60fd56985b1faa79cc38e585e7b7c7d2d596867704a7954dcd2a168c0f73e","observation_id":"66e2f336-3a1d-42fa-a17c-4159881331e2","resolution":{"observed_at":"2026-05-12T08:21:24.297719Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05233","last_updated":"2026-06-03T16:16:54Z","snapshot_observed_at":"2026-07-06T21:37:23.562748Z","submitted_at":"2025-06-05T16:50:23Z","title":"MesaNet: Sequence Modeling by Locally Optimal Test-Time Training","version":2},"cited_work":{"arxiv_id":"2506.05233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05233","snapshot_observed_at":"2026-07-04T19:30:07.288376Z","title":"Mesanet: Sequence modeling by locally optimal test- time training","venue":"cs.LG","work_id":"a56c0fb5-cd81-4e5e-982f-7cd7eef43563","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2506.05233","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:4896a77dff3058e75c4429dd81a5327c0db1056a33e71a4089db77de5d282e61","observation_id":"bb8b7f7b-f4c7-4ec3-b938-630a75f25846","resolution":{"observed_at":"2026-06-04T02:07:39.171975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":"2406.07887","doi":"10.48550/arxiv.2406.07887","metadata_source":"pith","pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"An Empirical Study of Mamba-based Language Models","venue":"cs.LG","work_id":"7a48323c-5291-43c0-93ea-ac7a32dd7fef","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:30f36af13a1b83a12d775710b4b57901431d87fbb3cbab5048494a7002b18c6f","observation_id":"98579f67-ec15-4123-ad7b-0588d2c509bd","resolution":{"observed_at":"2026-05-18T10:31:04.038637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The mamba in the llama: Distilling and accelerating hybrid models","venue":null,"work_id":"c1f5ae3d-1b60-4e3a-a88b-26e2975c5020","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:bdd908b7246599246fd393b92dd1869297b294fd31720d8b57c15430e1775b7d","observation_id":"31c73377-1c84-489b-98cd-dae9d5eac527","resolution":{"observed_at":"2026-05-14T08:05:37.538336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M1: Towards scalable test-time compute with mamba reasoning models","venue":null,"work_id":"2229ab39-a8b4-48c1-99a9-9f13bf5494d7","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:75c71eeaca7ebb404b1e9daf1e5281932ce2dfad2f422b458fe962a315c8148b","observation_id":"d67adf58-18a2-4995-9480-5d8e621832d2","resolution":{"observed_at":"2026-05-14T08:05:37.540001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8db6d916-9e50-4505-8679-9515706ee210","year":1960},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:bd204000d5249a5869f282b5406e82a31786a5506be9a72fb1b3b881e07c673d","observation_id":"5356abb7-9ac4-4a42-9bb1-bd0936c3871f","resolution":{"observed_at":"2026-05-14T08:05:37.541613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"f8bc78a2-815e-49f3-b92a-35cbf1067331","year":2022},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:d70ffdfb4b78fd6528073269973f7d050ac82d0a430349e5e82fb5c64ab103f7","observation_id":"71612217-148e-4283-bb0c-1cfb27be1269","resolution":{"observed_at":"2026-05-14T08:05:37.551956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":"3afbd19c-10fd-4d24-b652-94b3d3e1e6e3","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:f04edc1ed4228908ef9852d78271fbcb921e4bd1dc5eb49ea6d980b8f5fc54ad","observation_id":"412068f2-b15f-4266-acb1-1420bb73e247","resolution":{"observed_at":"2026-05-14T08:05:37.533035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":"fae20605-688a-40dd-a399-5d5de1efb7a6","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:d181e708e02f587dfbcfe832aaa8f82c4c5488396f55294c32eedda5247c1ace","observation_id":"8bc08899-e54e-4ec7-b1c7-61b869b9ce6e","resolution":{"observed_at":"2026-05-14T08:05:37.534723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3668","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:36.846362Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"43108a7e-1a66-452f-9a1a-194948f94c9f","year":2024},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:0cba64b72224ce0ec5aa144635488e0a9c60ddae9c38bdbdc6e0d448786fa56f","observation_id":"8a41a46f-e508-4d72-8d45-09fdfb443138","resolution":{"observed_at":"2026-05-12T01:16:13.870615Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":"6f5375f0-73a9-46ad-95be-c891d8d886d0","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:068c006646051ead05749cc00eb8ee6ee45bc198481c16cd92038e73bf72dc75","observation_id":"647af476-cda2-4fbc-abbe-77fa6825e88c","resolution":{"observed_at":"2026-05-14T08:05:37.577993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ape: Faster and longer context-augmented generation via adaptive parallel encoding","venue":null,"work_id":"2451f772-fa59-475a-9035-731bedee2f7a","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:10808a8345ab00de2748c64aa7ef414f8c4017eb05e8cf1d6c31dbcbb85b89d1","observation_id":"0a75c586-7ea7-4804-82b0-6ca2995911c0","resolution":{"observed_at":"2026-05-14T08:05:37.531221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":"80bc03d7-e3a0-4e34-9741-46367915925e","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:70d48a60358b96fe46740418da10d5e5c8be80b22784541080835d7a60d02d13","observation_id":"e6b20170-6593-4a3f-93b6-389b03d502ba","resolution":{"observed_at":"2026-05-14T08:05:37.529449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":"da4e4010-f383-47ac-8b76-ad6390ec19ab","year":2025},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:60efa44958d9d7200bfcb6582557c504907b13d966e1c1d63b5de31bae5f3cc5","observation_id":"b03622f6-866b-47b2-848d-461d9e794b13","resolution":{"observed_at":"2026-05-14T08:05:37.536451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12457","last_updated":"2022-02-25T01:50:22Z","snapshot_observed_at":"2026-07-06T12:41:29.877140Z","submitted_at":"2022-02-25T01:50:22Z","title":"Stacked Residuals of Dynamic Layers for Time Series Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2202.12457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.12457","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stacked residuals of dy- namic layers for time series anomaly detection","venue":null,"work_id":"a92254dd-d03b-46fa-9936-807a9f61cabe","year":2022},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2202.12457","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:43917ddb6ec5b95496b151fa22075e7fdce0149317dc2739d514d47cf390aa0f","observation_id":"4f4d1986-d94c-4de3-a448-3c909abf6af2","resolution":{"observed_at":"2026-05-12T08:21:24.281364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":7,"verified_exact":31,"verified_fuzzy":58},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 3 inbound Pith citation observations for arXiv:2605.08301."}