{"as_of":"2026-08-06T07:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c93a1fe86bcac5a12b7a3366098b50e9f7d4b07439f722e3cac9a49150dd58c","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T05:56:51.447893Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.30562/citation-record","integrity":"/paper/2606.30562/integrity","json":"/paper/2606.30562/citation-record.json","paper":"/paper/2606.30562"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.09433","last_updated":"2025-03-07T17:33:50Z","snapshot_observed_at":"2026-08-06T01:09:40.526196Z","submitted_at":"2023-04-19T06:00:26Z","title":"Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes","version":3},"cited_work":{"arxiv_id":"2304.09433","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09433","snapshot_observed_at":"2026-07-04T00:59:20.044507Z","title":"Language models enable simple systems for gen- erating structured views of heterogeneous data lakes","venue":null,"work_id":"c959d8fb-c98f-4998-9884-dfa66742091d","year":2023},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2304.09433","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:8e9c35d9ee75c3d01332eacf8727c7d96409d31a4a66dde470f6cf2cd4af7046","observation_id":"6378b773-e943-4c8b-8244-3e2257eccc3a","resolution":{"observed_at":"2026-06-30T08:44:28.031487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":"2402.18668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-07-09T12:46:14.690167Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":"cs.CL","work_id":"c542bc4f-de21-42d2-812b-b46f5fa9b434","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:d22ed23eb0663f4105dd3c86a5919e513b2a48acbb97585770b1c928ab74e92b","observation_id":"2cbf092b-14d8-41e9-b3f0-18b3a687240c","resolution":{"observed_at":"2026-06-30T08:44:27.957941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Transformers to ssms: Distilling quadratic knowledge to subquadratic models.Advancesin neural information processing systems, 37:31788–31812, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:893d967eb660499182c7a12769d86b92bf0397f970a8ae16edef1861d010e9e2","observation_id":"ca160262-2626-4636-b2d9-d1db4e3d979d","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14458","last_updated":"2025-02-23T13:02:09Z","snapshot_observed_at":"2026-07-06T20:39:43.403470Z","submitted_at":"2025-02-20T11:18:39Z","title":"Llamba: Scaling Distilled Recurrent Models for Efficient Language Processing","version":2},"cited_work":{"arxiv_id":"2502.14458","doi":"10.48550/arxiv.2502.14458","metadata_source":"pith","pith_arxiv_id":"2502.14458","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llamba: Scaling distilled recurrent models for efficient language processing.arXiv preprint arXiv:2502.14458","venue":"cs.LG","work_id":"114086d3-6e40-4b5c-b2a9-6d0819e2bfac","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2502.14458","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:9b5b8dac3aceaeb17a21aec606caf89022c0b0ca3a306b249baa2fd2e5cdc239","observation_id":"fe18b65a-dc66-4d42-b0c0-5e322cdb8030","resolution":{"observed_at":"2026-06-30T08:44:27.964101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T08:44:28.024362Z","title":"Retrieval-aware distillation for transformer-ssm hybrids","venue":null,"work_id":"cd9f2397-0e01-483b-b80e-3b638eced29c","year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:4da1f1c2dd5d8d249d5832faea6e461d695ae5ba62c1a611e020e7628723e2a4","observation_id":"529d5273-ca97-4c00-8d52-35ca2a09a9b7","resolution":{"observed_at":"2026-06-30T08:44:28.026122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:f60acce752d6ff7dac296f64f27df8c65cf5c6e8ec20c383b7195875c056fd2f","observation_id":"99ca53df-da31-488f-b89f-75004e19b9eb","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-04T18:37:12.098336Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":"2504.03624","doi":"10.48550/arxiv.2504.03624","metadata_source":"pith","pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-H: A family of accurate and efficient hybrid Mamba-Transformer models","venue":"cs.CL","work_id":"134d0eac-bc97-4065-9c60-e8fde9d20b48","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:db142e1b0dd97f42be2b99dde93b8402a72f6d1cf261d59bba29c7707d54eb0f","observation_id":"253d5645-3a5c-412f-a1e7-6a484d5d36be","resolution":{"observed_at":"2026-06-30T08:44:28.067278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":"2403.17297","doi":"10.48550/arxiv.2403.17297","metadata_source":"pith","pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternLM2 Technical Report","venue":"cs.CL","work_id":"dfa13e0e-1c3c-4fb6-943d-a19945bacdbe","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:6fde4c88d779fe58f7a37628b1cd7ce3db8dcbba889d6df718d9042e729d740e","observation_id":"e30ea469-1e5f-49e7-b50c-378befa4935f","resolution":{"observed_at":"2026-06-30T08:44:28.058419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:249f883d2b6efc357498d35ebc3bf99b63d1ff8efdc6d3204444b5b2105bd295","observation_id":"3c561deb-0734-4287-aec6-9a746e9a97bc","resolution":{"observed_at":"2026-06-30T08:44:28.061232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19928","last_updated":"2024-04-01T09:17:01Z","snapshot_observed_at":"2026-08-06T07:05:21.216187Z","submitted_at":"2024-03-29T02:32:15Z","title":"DiJiang: Efficient Large Language Models through Compact Kernelization","version":2},"cited_work":{"arxiv_id":"2403.19928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.19928","snapshot_observed_at":"2026-06-30T08:44:28.059566Z","title":"Dijiang: Efficient large language models through compact kernelization.arXiv preprint arXiv:2403.19928, 2024","venue":null,"work_id":"ee500094-d029-4e10-99e9-00a87f390758","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2403.19928","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:50a48aa16025bf1c8b188fbe78f259b9a5b71671425ecac9ecbd4e3481dce3f1","observation_id":"792c7e69-cce9-44df-891a-04d3f9b4752b","resolution":{"observed_at":"2026-06-30T08:44:28.061053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:26:56.609897Z","title":"Hybrid linear attention done right: Efficient distillation and effective architectures for extremely long contexts.arXiv preprint arXiv:2601.22156","venue":null,"work_id":"8aa7d1de-d8b8-4e4a-912d-fbd539d2fd5b","year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:4d656858790abc0a091687eb38fdcc8e02257e7b0f9f2e437644685040ad3963","observation_id":"691a4607-a72e-44ec-8251-90e8a8179933","resolution":{"observed_at":"2026-06-30T08:44:28.064058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Metala: Unified optimal linear approximation to softmax attention map.Advances in Neural Information Processing Systems, 37:71034–71067, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:18e44922989ab302ab5cc9ce023282b68758328fc07197edb08671544969aef6","observation_id":"1e68bdab-a9c2-4767-916b-d01850e48c37","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:714791d6cbe8a60b43dd4a4e2e3feacc793a689ec375008ad9a24afcb4cc0315","observation_id":"24127a82-0dbf-4eba-a758-237532d86cb3","resolution":{"observed_at":"2026-06-30T08:44:28.069926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:dda22a22ea7c42b1865c1f58de5e476b3c28aff2e8ec7a7f256ad3779052538f","observation_id":"110f7a9d-f44e-4198-a983-9721c7b6eb90","resolution":{"observed_at":"2026-06-30T08:44:28.074982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:9bc436ff3bc1a0c1a2bb333a9b4752e939dc63ecdc7ed24fb0c9ac6ee2f4a7f8","observation_id":"a7519924-cc5d-42f5-b1a1-5f0cbd608222","resolution":{"observed_at":"2026-06-30T08:44:28.080460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07019","last_updated":"2026-04-15T13:24:10Z","snapshot_observed_at":"2026-08-05T10:06:22.129293Z","submitted_at":"2025-10-08T13:44:57Z","title":"Native Hybrid Attention for Efficient Sequence Modeling","version":3},"cited_work":{"arxiv_id":"2510.07019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.07019","snapshot_observed_at":"2026-07-03T13:48:20.314999Z","title":"Native Hybrid Attention for Efficient Sequence Modeling","venue":"cs.CL","work_id":"f0ff0e30-d471-4d57-a0cd-7de4b22fd03a","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2510.07019","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:32bf9dd58893988c9c0fbfe44e11ecfb400de1dd4516fcc4a0cbb9e0e77373e7","observation_id":"84fe8c76-4b81-4def-9814-1954a2ea2e6d","resolution":{"observed_at":"2026-06-30T08:44:28.030389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:26:12.834355Z","title":"Jacob Dunefsky, Philippe Chlenski, and Neel Nanda","venue":null,"work_id":"d7938f40-a443-4bee-b8b8-25a766644446","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:58ac66e052b16853e46dd69e0852dcd96f507e768549e7ae19ea18408268033e","observation_id":"e5607450-8870-4483-a686-f90f8bda82ac","resolution":{"observed_at":"2026-06-30T08:44:28.035637Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:8a7955bd9bd580189cae292ab6085f384519050d37b6a1bdfb6d1c55ca49360d","observation_id":"9b613bd2-1361-4059-a51c-5406297ad6c1","resolution":{"observed_at":"2026-06-30T08:44:28.044488Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-07-06T18:20:14.021759Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":"2405.16712","doi":"10.48550/arxiv.2405.16712","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zamba: A compact 7B SSM hybrid model","venue":"arXiv (Cornell University)","work_id":"042a830e-b7c4-4954-bd51-2f8c14ef9fa5","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:9ba674d776d1292d5ed051893ea84245bde9ba63f22d447abca35aa957ff3d16","observation_id":"1e300dd8-4d6c-453a-9656-bca6e1ef25c9","resolution":{"observed_at":"2026-06-30T08:44:28.050046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.03005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T08:44:28.023504Z","title":"Radlads: Rapid attention distillation to linear attention decoders at scale.arXiv preprint arXiv:2505.03005, 2025","venue":null,"work_id":"e06f34d2-7cb7-4cf3-ab52-bbec8ffb8d3f","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:b451b39b4040b40c61f5a6f5830008d9c3a3289769336a21b7a870c420946b30","observation_id":"04c1926e-3fef-4c65-971f-355cbc71f955","resolution":{"observed_at":"2026-06-30T08:44:28.025419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:f98737f76fb3a6eea8e793bb8f18ffd5b98d14078921c1dd4477767d5ef23e5d","observation_id":"d93ffcb0-de7b-4b4f-b229-a2d321002968","resolution":{"observed_at":"2026-06-30T08:44:28.040975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:df8278005101e0f8fc671fa8c6596100ab786fe349add9bd6b9ade1a6565f54b","observation_id":"69398d96-ea33-4a84-8340-1ba164b0db09","resolution":{"observed_at":"2026-06-30T08:44:28.072422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.15884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:33.450397Z","title":"Jet-nemotron: Efficient language model with post neural architecture search","venue":null,"work_id":"ce920786-ab4a-4858-a933-0637bfc7b2f9","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:b2f102ecea4734b6ae0d1546b2bbc7d77d5eb868f0f6fe23b6141fabdc66c6e5","observation_id":"ff1c374e-90f9-46c4-bfa5-65a17de2543f","resolution":{"observed_at":"2026-06-30T08:44:28.067447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:d053d1a4aee5f359edac64c8ef71e8373da807c6e8dc98b651b1faea83656a7a","observation_id":"b9a2f5de-8dab-4a74-aa5d-172a159354c5","resolution":{"observed_at":"2026-06-30T08:44:28.028797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:6c07b6ca09820b2f2ee122037e3d5afc0f23250873fd2eae0f360609ec3c492c","observation_id":"ad3f96d0-4f74-4699-856b-e716726fe787","resolution":{"observed_at":"2026-06-30T08:44:27.994760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.02475","doi":"10.48550/arxiv.2506.02475","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thomas Jiralerspong and Trenton Bricken","venue":"ArXiv.org","work_id":"a738296f-0c2f-43cc-bb34-78e24cdb91c9","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:5fa2cf8eafd4dc69435c168fc7695c143d3c021d20b12719610f6a1f9558276f","observation_id":"4501207c-4b93-4749-a091-45643507ec53","resolution":{"observed_at":"2026-06-30T08:44:28.001897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:f0bec5744ff75c240329ac0a104740ce3190d83b5ba4f89ea45ab1f8e424355e","observation_id":"711f743b-9111-40c6-a29c-9c255f6753f6","resolution":{"observed_at":"2026-06-30T08:44:28.013474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Finetuning pretrained transformers into rnns","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:ec4c10ed26f55358ff47179fd081cd7da9b98c7c1dddd836eee106972832ab3d","observation_id":"077fadb5-df37-493e-8c97-9131ffcb12dc","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:ae74ce768e58602ab48ef7001d2ae8ecb383742b99f3f28ffd4d360f843385a2","observation_id":"1c4fd85f-c273-4c8f-bb4e-e4c61e9ba7a8","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:024278398765eca034bc4a82e95b22d683d2d7a32f85834936fc63793662f10c","observation_id":"f454b5e6-fb4e-47f8-b9b8-4a00cf4497ea","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:57.815851Z","title":"Li, Berlin Chen, Caitlin Wang, Aviv Bick, J","venue":null,"work_id":"74e489b6-3a26-4e84-9578-7f3d90119238","year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:a9367daac724c327ee027198f9ea88078a11ec0b0257e790c742c04adae65975","observation_id":"39fc0d5a-a5f7-463c-ab25-f431eba3cd48","resolution":{"observed_at":"2026-06-30T08:44:28.010763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01496","last_updated":"2025-05-07T07:42:11Z","snapshot_observed_at":"2026-07-06T20:45:41.540398Z","submitted_at":"2025-03-03T13:08:00Z","title":"Liger: Linearizing Large Language Models to Gated Recurrent Structures","version":2},"cited_work":{"arxiv_id":"2503.01496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01496","snapshot_observed_at":"2026-07-09T01:45:50.818008Z","title":"Liger: Linearizing large language models to gated recurrent structures.arXiv preprint arXiv:2503.01496","venue":"cs.CL","work_id":"55622c06-d5cf-48ff-8c05-e3aed5f2a0d4","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2503.01496","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:808df20963faa018acfbe8e4321f791ba71435a2bdb00c7578da9fb1da29bcf7","observation_id":"f97b8acd-2ee9-411c-82fc-d1f741cc0eb9","resolution":{"observed_at":"2026-06-30T08:44:28.046828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:f50cb708daadbf99a84e77648a335bb9d1dd8a3534c7156bcb6e85941e9b5e89","observation_id":"a347fbee-04b6-4ca8-8fa3-66283034c883","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:37:40.375063Z","title":"Distilling to hybrid attention models via kl-guided layer selection","venue":null,"work_id":"699c93e0-d1e0-4282-8c63-305282792cd3","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:1a6dc2fd47c3ba976b6e37b88e62343514b65f13f81dcee38e9a6a72da41a562","observation_id":"adc5bc30-2435-4923-8dbc-ff9884a0b96e","resolution":{"observed_at":"2026-06-30T08:44:27.981200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":"2403.19887","doi":"10.48550/arxiv.2403.19887","metadata_source":"pith","pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","venue":"cs.CL","work_id":"129df0fe-8a66-4077-8991-3557cfa38274","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:4ab2cdbdb31247c988690c1d87c040595d55b1ebfdccb5f67a4c057cf6bf8b13","observation_id":"3a32e2fd-adb8-4d06-868d-c027357ed8b1","resolution":{"observed_at":"2026-06-30T08:44:28.028060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.04541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T08:44:28.034929Z","title":"Lycheedecode: Accelerating long-context llm inference via hybrid-head sparse decoding","venue":null,"work_id":"313785cb-9e7d-4bcb-a793-f1e42572b258","year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:b1f02776890c1f91f60ccffc6f87808f2076d711e8e19ca5fc25a05dbc50372e","observation_id":"951161f6-a95d-4c5a-a1ed-e0ab304ccc1b","resolution":{"observed_at":"2026-06-30T08:44:28.036457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:54f3eaa827f5c3b2250a81447340f3427d29d1925dfd34209cf71717bd2d9ab2","observation_id":"d7bee9ed-cd35-4e30-820b-28bf82eaed8e","resolution":{"observed_at":"2026-06-30T08:44:28.041702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Openceres: When open information extraction meets the semi-structured web","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:78f0854df343456baf2f475e84af749afd5eb8ddb6db7836990e1be2aac9dd7f","observation_id":"204e3832-f957-4128-8687-4db889fd8996","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:15d19314b95943bca036a1b491ce82b133ffc7708b8156db4c46dc19dd3c0fe3","observation_id":"1ce228b4-6596-431c-8af7-15acfe92d8da","resolution":{"observed_at":"2026-06-30T08:44:28.047283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06640","last_updated":"2024-05-10T17:59:08Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:08Z","title":"Linearizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.06640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.06640","snapshot_observed_at":"2026-07-09T01:45:50.807991Z","title":"Let’s verify step by step","venue":"cs.CL","work_id":"87cc9178-d804-46fe-8128-c9074077dd04","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2405.06640","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:f116df22e962f9a4d5f4cb68ce8ae97c2de86b33faa1e21350df5352ef085741","observation_id":"c4e0f3d8-37d8-48e1-a8c3-60528a04717a","resolution":{"observed_at":"2026-06-30T08:44:27.990513Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03444","last_updated":"2026-06-15T18:55:41Z","snapshot_observed_at":"2026-07-13T13:22:23.195279Z","submitted_at":"2026-04-03T20:36:34Z","title":"Olmo Hybrid: From Theory to Practice and Back","version":4},"cited_work":{"arxiv_id":"2604.03444","doi":"10.48550/arxiv.2604.03444","metadata_source":"pith","pith_arxiv_id":"2604.03444","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Olmo Hybrid: From Theory to Practice and Back","venue":"cs.LG","work_id":"4ae5e12d-84a5-42ed-9736-ca43934b533b","year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2604.03444","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:032016289c211e0b6bd43cf373d62edf4a302585f3b3450e263bd4db73821a24","observation_id":"8fac34ce-565f-44b1-8c8d-75223dc12f4c","resolution":{"observed_at":"2026-06-30T08:44:28.022943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T13:53:49.95156+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T13:53:49.95156+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20339","last_updated":"2025-02-27T18:08:16Z","snapshot_observed_at":"2026-07-06T20:43:55.138388Z","submitted_at":"2025-02-27T18:08:16Z","title":"Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners","version":1},"cited_work":{"arxiv_id":"2502.20339","doi":"10.48550/arxiv.2502.20339","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking slow, fast: Scaling inference compute with distilled reasoners.arXiv preprint arXiv:2502.20339, 2025","venue":"ArXiv.org","work_id":"c9e6217c-a47e-4f45-9343-53d0475a85c6","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2502.20339","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:a53542c3bdb5c8d18b2f924240facb51136d2ec952effe9e89685eaa86756a7d","observation_id":"e8094d3a-8494-4fa8-a698-fc0581b6540a","resolution":{"observed_at":"2026-06-30T08:44:28.077719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:2826ec686b7d5ede7bf73d403b009e31c0c973cdcc59c968731cbd4ca4a7b8a5","observation_id":"8495e867-b9e2-442d-bd84-cb513c14417e","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Yarn: Efficient context window extension of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:848ef8e329d31541c5769033e8d746324a19edf5da505202bc9069c158b5e987","observation_id":"914d2c52-64d6-4bee-b3ca-a305c6f8e184","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Hierarchically gated recurrent neural network for sequence modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:8daf1a3bae75de0cc3fd5fa5333cd7ff184aac4a31c7c5b160d315ab5a25a3cd","observation_id":"34ca6402-f0aa-4515-9d94-61c396965d93","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04658","last_updated":"2024-01-15T14:57:29Z","snapshot_observed_at":"2026-08-03T19:06:46.657140Z","submitted_at":"2024-01-09T16:27:28Z","title":"Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language Models","version":2},"cited_work":{"arxiv_id":"2401.04658","doi":"10.48550/arxiv.2401.04658","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04658","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lightning attention-2: A free lunch for handling unlimited sequence lengths in large language models.arXiv preprint arXiv:2401.04658","venue":"arXiv (Cornell University)","work_id":"02c34d0b-5e0a-48e5-9c0d-9d5474fb4c00","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2401.04658","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:1050b9708463d84a21dd99caf0c9e5e008a849fe2ea6432f6585df0af01dfc63","observation_id":"375ebb43-7efb-4d36-8eec-854e9478d337","resolution":{"observed_at":"2026-06-30T08:44:28.072509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07904","last_updated":"2024-08-19T17:16:55Z","snapshot_observed_at":"2026-08-01T18:05:06.274262Z","submitted_at":"2024-04-11T16:43:03Z","title":"HGRN2: Gated Linear RNNs with State Expansion","version":2},"cited_work":{"arxiv_id":"2404.07904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07904","snapshot_observed_at":"2026-07-03T17:28:44.977281Z","title":"Hgrn2: Gated linear rnns with state expansion.ArXiv preprint, abs/2404.07904","venue":null,"work_id":"62f21939-fe4f-4159-bb1e-6a303fdc7b42","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2404.07904","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:15bc949b43c1c79e6dc717b2777226be49bf0fc437cc997edb9f83736417e770","observation_id":"7d24fd88-1556-4edf-a88b-f2fd67fe5c67","resolution":{"observed_at":"2026-06-30T08:44:28.077887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.Advances in Neural Information Processing Systems, 38:100092–100118, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:c262364bc24041158611ab6e477f3edeb0c5359fec639eba3becb9c01909fae6","observation_id":"80be2391-2168-4dcd-bf61-d220cd1c23d4","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Qwen3-coder-next technical report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:3ada43c4559fc71f1bc304defde85008c0364cfb741149c59ce759ff650460b7","observation_id":"7b6b2e66-0acc-46d0-8314-dee7e455b15a","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:d161da9c232e37d4acd5b611b88d67d8b43b890453662bac01925c5173c9ee94","observation_id":"6b5faecf-4ace-4fde-9006-e26fc955ad4f","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Know what you don’t know: Unanswerable questions for squad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:77b7d3ec690fb45a1eeeb43b434031f9acfdaae4e68bfbb8d467847c0a8edf07","observation_id":"d6f40a52-5ef1-4e7f-86dd-f674dd433e27","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:6983b7d182611f702624a9a67db49a32a5210c0b9a88c628566c7199959229eb","observation_id":"718f5c9e-189d-49e1-970c-ac9c5b578a98","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:975bb3bb94b3b125cd36b3c7fc97768da43edf92aadd8eb4c9c5713bff8083d7","observation_id":"ae1d793e-725e-4f6e-82a4-0b04ebb2f26a","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09834","last_updated":"2025-08-13T14:13:46Z","snapshot_observed_at":"2026-08-05T20:53:01.056731Z","submitted_at":"2025-08-13T14:13:46Z","title":"Speed Always Wins: A Survey on Efficient Architectures for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.09834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09834","snapshot_observed_at":"2026-06-30T08:44:28.037573Z","title":"Speed Always Wins: a survey on efficient architectures for large language models","venue":null,"work_id":"fd87decc-a230-45f1-a04f-3b4579027843","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2508.09834","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:253659246ac518af4e95c67a891091ae47bc2505c0427dc4177ddc770c4492c6","observation_id":"77bc78ef-3414-4038-82cb-22fffc078316","resolution":{"observed_at":"2026-06-30T08:44:28.039242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05447","last_updated":"2025-04-15T07:51:10Z","snapshot_observed_at":"2026-07-06T20:48:31.837669Z","submitted_at":"2025-03-07T14:17:45Z","title":"Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":"2503.05447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05447","snapshot_observed_at":"2026-06-30T08:44:28.012784Z","title":"Linear-moe: Linear sequence modeling meets mixture-of-experts","venue":null,"work_id":"f876a29a-94be-4453-b295-2eab8c74128f","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2503.05447","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:12b8305be59eb6c24230650a7775c07345aac5368889777b3787b4960e091116","observation_id":"d2e80d1e-e17f-483a-9f4b-00104bb7aee9","resolution":{"observed_at":"2026-06-30T08:44:28.014211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:6e4c8b2c6b33898936e6bd72fd85d92605e0d9d6575062f6349495d3acd03d08","observation_id":"3b8599c0-e6fb-4d1b-9c1e-94ba99e40b3b","resolution":{"observed_at":"2026-06-30T08:44:28.058764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Attention is all you need.Advancesin neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:787ee681894400ce8d7423f798c68a53abfab6ece5dba56b09030de91d199237","observation_id":"cbb500e6-544f-4213-ab39-3a38a786703d","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-07-06T21:54:15.148296Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":"2507.06457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06457","snapshot_observed_at":"2026-07-03T09:47:59.840263Z","title":"org/abs/2507.06457","venue":"cs.CL","work_id":"1a2feeca-9d02-4d2b-826d-df79744dfe4b","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2507.06457","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:7b65338d25cb44981907e6860811a917dd3f8c6f3e28a50b33fca95395967239","observation_id":"81f16ff3-92da-44af-ba65-e6c9d243e07e","resolution":{"observed_at":"2026-06-30T08:44:28.070031Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"The mamba in the llama: Distilling and accelerating hybrid models.Advancesin Neural Information Processing Systems, 37:62432–62457, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:f4964388f92b75375a93c28b0aa3ca8e282de216a8f99c58cc9a33cb341479fc","observation_id":"38864e67-6cd2-41d0-83e7-0fcb2dfc2f92","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Rnns are not transformers (yet): The key bottleneck on in-context retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:eae6631cdce03a13aea96e1322c11fdf4af6d26f3ebec4bc5acf3efb64ca2fea","observation_id":"29e77731-73f7-40c8-9eaa-796acb276a58","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:8fdc4ffd8d17e308f059176c195691c420a6fa3b5ec0e8a199a35e5c82c0a901","observation_id":"ea84efed-c492-41a8-b2c2-1db6d6ca5cbc","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:57fdd27285246fb4bbe38ba0a884e7786b0c5c904e7abd06acd05640fd9a4c88","observation_id":"57de7c10-6b80-4e89-adf2-b7343ec3a232","resolution":{"observed_at":"2026-06-30T08:44:27.960596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Zebra-llama: Towards extremely efficient hybrid models.Advancesin Neural Information Processing Systems, 38:78167–78194, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:f43a1fccbe95a04876c7f8688393fc4499f703a05d194891253aa91f8caa518e","observation_id":"e943c0d3-134f-470b-9c69-1482387bd0b2","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Fla: A triton-based library for hardware-efficient implementations of linear attention mechanism, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:da974c566bfeb760912eea68e0190c97445e0ca067d51d6469a64a28dfd3d086","observation_id":"d6dd6b3f-78f5-40f6-a1f5-d51d89ff199b","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":"2312.06635","doi":"10.48550/arxiv.2312.06635","metadata_source":"pith","pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","venue":"cs.LG","work_id":"65a18a30-6e80-4b64-a026-bb0368e38872","year":2023},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:cf6c55effdaa170cbe6ab13c64a9f7bbe0cee6518f511a9c312db06b0aadd39c","observation_id":"8f05ca20-d1a9-4624-bbca-44d251411af1","resolution":{"observed_at":"2026-06-30T08:44:28.015972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":"2412.06464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-07-10T21:57:39.161066Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":"cs.CL","work_id":"884939d3-e283-4625-bff4-b7e0e4cc2a6e","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:dabfd03e98610660bcbd6a06bcea710d0329896f7177e877fcb3b82457aac8d1","observation_id":"e4c86267-1330-41b7-bda4-d58736fd2f15","resolution":{"observed_at":"2026-06-30T08:44:28.033859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Parallelizing linear transformers with the delta rule over sequence length.Advancesin neural information processing systems, 37:115491–115522, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:fbc44e8ac3858994ea82667a5350ccc36a6022db30cdc7060e976273794a030c","observation_id":"a77999e0-0390-4616-b17e-c450bfbc4348","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 57th annual meeting of the association for computational linguistics, pages 4791–4800, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:604520c2de39a86bb1eb5a4579be1a9000eb2324a222c465b8ef60700b9233d1","observation_id":"9fafb3ec-239e-42a9-ab44-b8506dc7ccb3","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10254","last_updated":"2025-03-05T21:57:04Z","snapshot_observed_at":"2026-08-05T10:56:29.177473Z","submitted_at":"2024-10-14T08:10:34Z","title":"LoLCATs: On Low-Rank Linearizing of Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.10254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10254","snapshot_observed_at":"2026-07-09T01:45:50.782998Z","title":"Lolcats: On low- rank linearizing of large language models","venue":"cs.LG","work_id":"9d869e4a-9d42-44fa-bb5d-b5e48ac4aed3","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2410.10254","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:6f238fcb034237834ac7eccd671cd346497b0fdb3ed6a1525c466a48fb04fa66","observation_id":"c3b9f803-7731-4e7b-9a09-f4b974e9bc04","resolution":{"observed_at":"2026-06-30T08:44:28.083529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04347","last_updated":"2024-02-06T19:31:26Z","snapshot_observed_at":"2026-08-05T14:10:32.523531Z","submitted_at":"2024-02-06T19:31:26Z","title":"The Hedgehog & the Porcupine: Expressive Linear Attentions with Softmax Mimicry","version":1},"cited_work":{"arxiv_id":"2402.04347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.04347","snapshot_observed_at":"2026-07-09T01:45:50.823193Z","title":"org/P19-1472","venue":"cs.LG","work_id":"677d5107-6308-4640-bd1a-47e49d1ec496","year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2402.04347","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:350c8e926dd4e15ac2fe8e92cf76d805d00683091dab5fefa37b597893ff2a3d","observation_id":"4d908499-bde7-424c-bd3f-adc9824ae1a2","resolution":{"observed_at":"2026-06-30T08:44:28.074977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:56:51.447893Z","title":"Gated slot attention for efficient linear-time sequence modeling.Advancesin Neural Information Processing Systems, 37:116870–116898, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:23265af733583d1954e8f0f6fc6adb8289bdbaf678084e731e8ee962180a90e3","observation_id":"98c9a88e-de1e-4af1-838b-d56d5118a0d3","resolution":{"observed_at":"2026-06-30T05:56:51.447893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-07-06T22:05:03.342407Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:5a2c79c88811937e5a0b97c5c0f697d091136e0bce7c3be1a7e6c9c3d24469a0","observation_id":"4e091ae8-936e-4da1-9189-ce5823b5a42a","resolution":{"observed_at":"2026-06-30T08:44:28.064214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":26,"verified_exact":39,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2606.30562."}