{"as_of":"2026-08-08T10:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7b75c8beda33dd229914efded3b53ea52079604238aa5b502c4bc32d9409dc6","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:31.702035Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:22:45.702572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T18:25:00.050125Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"cited_work":{"arxiv_id":"2505.22135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22135","snapshot_observed_at":"2026-06-30T18:25:00.050125Z","title":"Rad: Redundancy- aware distillation for hybrid models via self-speculative decoding.arXiv preprint arXiv:2505.22135","venue":null,"work_id":"4a71bd4e-659a-4920-a6c9-c48d3555bb1f","year":2025},"citing_paper":{"arxiv_id":"2604.24715","last_updated":"2026-04-27T17:23:37Z","snapshot_observed_at":"2026-08-02T10:33:56.860167Z","submitted_at":"2026-04-27T17:23:37Z","title":"Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:37.485602Z"},"links":{"cited_paper":"/paper/2505.22135","citing_paper":"/paper/2604.24715"},"observation_digest":"sha256:78e3f1272f67fabbc4c0e0154c4da10137cb81b7d882dfa66b4a9190ab3ce44a","observation_id":"1979501e-7fdf-4a9e-a710-451b31732a64","resolution":{"observed_at":"2026-05-11T22:01:10.802659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"cited_work":{"arxiv_id":"2505.22135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22135","snapshot_observed_at":"2026-06-30T18:25:00.050125Z","title":"Rad: Redundancy- aware distillation for hybrid models via self-speculative decoding.arXiv preprint arXiv:2505.22135","venue":null,"work_id":"4a71bd4e-659a-4920-a6c9-c48d3555bb1f","year":2025},"citing_paper":{"arxiv_id":"2605.01106","last_updated":"2026-05-01T21:25:25Z","snapshot_observed_at":"2026-08-03T02:12:52.295417Z","submitted_at":"2026-05-01T21:25:25Z","title":"Component-Aware Self-Speculative Decoding in Hybrid Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T18:40:17.017805Z"},"links":{"cited_paper":"/paper/2505.22135","citing_paper":"/paper/2605.01106"},"observation_digest":"sha256:13198cc5306dc5d107b5a47a3f1062f7aff2a2679bb75a0a1c9458ad94db100c","observation_id":"697489d4-87b9-4603-9952-c15806008e35","resolution":{"observed_at":"2026-05-11T16:06:40.749250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"cited_work":{"arxiv_id":"2505.22135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22135","snapshot_observed_at":"2026-06-30T18:25:00.050125Z","title":"Rad: Redundancy- aware distillation for hybrid models via self-speculative decoding.arXiv preprint arXiv:2505.22135","venue":null,"work_id":"4a71bd4e-659a-4920-a6c9-c48d3555bb1f","year":2025},"citing_paper":{"arxiv_id":"2605.18643","last_updated":"2026-06-08T03:38:38Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:50:48Z","title":"Post-Trained MoE Can Skip Half Experts via Self-Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T12:00:35.496822Z"},"links":{"cited_paper":"/paper/2505.22135","citing_paper":"/paper/2605.18643"},"observation_digest":"sha256:64a4df151fb6df6dbaf2559633b3fe0419ec72937662276197371e805c4b271d","observation_id":"bd2fc1fd-38a6-409a-8940-04dabbe38e7e","resolution":{"observed_at":"2026-05-20T12:03:15.184871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"cited_work":{"arxiv_id":"2505.22135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22135","snapshot_observed_at":"2026-06-30T18:25:00.050125Z","title":"Rad: Redundancy- aware distillation for hybrid models via self-speculative decoding.arXiv preprint arXiv:2505.22135","venue":null,"work_id":"4a71bd4e-659a-4920-a6c9-c48d3555bb1f","year":2025},"citing_paper":{"arxiv_id":"2605.18643","last_updated":"2026-06-08T03:38:38Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:50:48Z","title":"Post-Trained MoE Can Skip Half Experts via Self-Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T18:22:45.702572Z"},"links":{"cited_paper":"/paper/2505.22135","citing_paper":"/paper/2605.18643"},"observation_digest":"sha256:6d3ee6d680a322c55e462722468a3a4eb02be1ccba496fd1e39e88cf0e2f4b17","observation_id":"6c0ae147-ab2a-483c-9629-e5dca0897884","resolution":{"observed_at":"2026-06-30T18:25:00.051504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22135/citation-record","integrity":"/paper/2505.22135/integrity","json":"/paper/2505.22135/citation-record.json","paper":"/paper/2505.22135"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:35.877048Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"e4130b57-f905-4ad5-8ce1-7e98e4054289","year":null},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:26.790813Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:351ba688a679305d7b0b3d6ec8f33272962290ad3865b69dcaf49852e6e7957d","observation_id":"b1d6a737-a5a7-4442-9199-b5d0eb899580","resolution":{"observed_at":"2026-08-07T13:20:36.060030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19146","last_updated":"2025-06-03T12:02:03Z","snapshot_observed_at":"2026-07-06T19:58:31.184255Z","submitted_at":"2024-11-28T13:45:42Z","title":"Puzzle: Distillation-Based NAS for Inference-Optimized LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19146","snapshot_observed_at":"2026-08-07T13:20:26.989808Z","title":"Puzzle: Distillation-based NAS for inference-optimized LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:26.989808Z"},"links":{"cited_paper":"/paper/2411.19146","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:568f5d7cdec83b42b615c4cd4b2cbf2d4e24114975764755f0151acd4b5bd7ad","observation_id":"3d0bfba0-6fbf-47d1-865a-ba680d1ea225","resolution":{"observed_at":"2026-08-07T13:20:26.989808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.naacl-main.72","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:35.631461Z","title":"On attention redundancy: A comprehensive study","venue":null,"work_id":"cdc13574-ae45-4157-923b-329f93473c9c","year":2021},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.103525Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:b19fdee45ca4202781c19b3888968835cc1307fe3b5c4450b50aaaec84c36b88","observation_id":"7c9f6219-ef5a-41ae-815f-b24b6efb8679","resolution":{"observed_at":"2026-08-07T13:20:35.760682Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:35.409868Z","title":"Xing, J Zico Kolter, and Albert Gu","venue":null,"work_id":"7a20d17a-4dd5-4f02-9cbd-2d03eb0af98c","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.248509Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:371eefb0a16631d1260f8009247bff1ac8b6028e5da3d86d9d929aab710a4547","observation_id":"37df9508-f6c9-4ea0-a92a-8dd431c00551","resolution":{"observed_at":"2026-08-07T13:20:35.505508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-07T16:08:37.984756Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-07T13:20:27.356000Z","title":"Nemotron-H: A family of accurate and efficient hybrid Mamba-transformer models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.356000Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:a9e9f637211bea6ede81daec69995f39bd30e2b32987ed820cb40ab430966246","observation_id":"b38696a6-12dd-4325-b989-cdd99ed49a36","resolution":{"observed_at":"2026-08-07T13:20:27.356000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T13:20:27.450977Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.450977Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:9224e0110effc87b8c29a7d6c1b850d681a76c15584b9b13603f492e2896d76b","observation_id":"ff0ac070-64ca-4102-9d9f-9fcba4d176da","resolution":{"observed_at":"2026-08-07T13:20:27.450977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10323","last_updated":"2024-06-14T17:44:08Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:44:08Z","title":"GenQA: Generating Millions of Instructions from a Handful of Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10323","snapshot_observed_at":"2026-08-07T13:20:27.547714Z","title":"GenQA: Generating millions of instructions from a handful of prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.547714Z"},"links":{"cited_paper":"/paper/2406.10323","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:bf84beb52ba728b8bd8bf2e29e806ba2f2b265e18224b4670467d081ddcd56d9","observation_id":"363d877d-4e92-41a7-ac51-4bbce35aff6f","resolution":{"observed_at":"2026-08-07T13:20:27.547714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:27.628183Z","title":"Streamlining redundant layers to compress large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.628183Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:31edcd35d9287eebafad60576234056b7cdc6f818f64841adf5c119a3ea5a89d","observation_id":"59bef50d-e274-414d-ab60-f4a43793b7e6","resolution":{"observed_at":"2026-08-07T13:20:27.628183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:27.719920Z","title":"Stuffed mamba: State collapse and state capacity of rnn-based long-context modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.719920Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:8880957f9174a1e54ea864bcb580b6c31c83cfa08f78df86d9ea41ec8df23821","observation_id":"8753613a-08b4-4139-ba3d-9870820ea493","resolution":{"observed_at":"2026-08-07T13:20:27.719920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:20:27.892094Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:27.892094Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:512ce8f4cd0e05964f51a11c53aab45f421ae8e9c99a87b9dbc64c3b86dcdb0a","observation_id":"8c5c7f89-39fa-4751-8e52-9cbae0213827","resolution":{"observed_at":"2026-08-07T13:20:27.892094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:28.023710Z","title":"Analyzing redundancy in pretrained transformer models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.023710Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:906fba811c3a401e70ee136b4447f87864ac7e5b57367ac55503f3a127edb904","observation_id":"384e185f-0837-47e5-b562-9587a6e48c20","resolution":{"observed_at":"2026-08-07T13:20:28.023710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:34.948488Z","title":"Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"06aab0ea-7aae-4553-b297-2d01930d5a59","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.294265Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:d75d9f3c189461464f1a1ef3d20001e3a1f8ae9f31cf0009ee4c14fce35e5693","observation_id":"583648ac-4682-4bdd-9aff-17ef39464327","resolution":{"observed_at":"2026-08-07T13:20:35.041855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:34.735485Z","title":"Born again neural networks","venue":null,"work_id":"08eedc73-c14f-4ad5-9521-6eaa74e9e198","year":2018},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.378302Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:67bf1424b52eebd7ed3925da957a5bbc302e09457d63f42bbebda739877f0bb1","observation_id":"cc73098e-1da3-4970-97b0-e7bf48a4461d","resolution":{"observed_at":"2026-08-07T13:20:34.845967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:28.465318Z","title":"A framework for few-shot language model evaluation, September 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.465318Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:c3a8483984f62615a080d2977563e0db7df82a2f5f2b615fca719ef918565192","observation_id":"71bc3d20-18fb-46f7-8624-67b907939de3","resolution":{"observed_at":"2026-08-07T13:20:28.465318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-07-06T18:20:14.021759Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-07T13:20:28.522002Z","title":"Zamba: A compact 7B SSM hybrid model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.522002Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:a9cceb55a7e771422882bdcfc529938c2951be5de45fa2344cc5a87fb35e2bf1","observation_id":"10680adf-502b-468a-802e-fa5f7ad8fe13","resolution":{"observed_at":"2026-08-07T13:20:28.522002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:28.654716Z","title":"RADLADS: Rapid attention distillation to linear attention decoders at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.654716Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:c7349296ef4c7ce9348dc5c65f80dfbd1bd99a8d496842f4a58ee9f8a32749c3","observation_id":"6ae875eb-0f81-4bda-88bb-554d104e26fd","resolution":{"observed_at":"2026-08-07T13:20:28.654716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:34.527943Z","title":null,"venue":null,"work_id":"f77d62fb-1a66-42a3-841d-6edfba338f30","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.773262Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:2371cf985914877de3dc4bab0f63ab439ce84cdee41fc813b18c34ea5bf32b7d","observation_id":"8c2edfd2-3690-4b7b-a3bf-b2f719c17cbf","resolution":{"observed_at":"2026-08-07T13:20:34.597696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T13:20:28.862191Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.862191Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:39688ecccc59a80a6019c1ebd3871a8986deefe4ae65325ac65aed668d48b7c1","observation_id":"505045e6-a7dd-4d84-98fe-510186747f4a","resolution":{"observed_at":"2026-08-07T13:20:28.862191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:28.974218Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.974218Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:0c1779a73274a6da6426c6132d77b4efbdec2c764d0b454061071ff2601f539d","observation_id":"792ca933-5ff7-49ee-826d-caf3319ca0ea","resolution":{"observed_at":"2026-08-07T13:20:28.974218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:29.130322Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.130322Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:55e73d35094812e10c4f1f874aad2a1f1d2f8b9d74937cdc0a6f5b06b8aef612","observation_id":"15bcccc1-c910-4cdc-baed-262a36cc83da","resolution":{"observed_at":"2026-08-07T13:20:29.130322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-07-06T17:12:10.787061Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-07T13:20:29.178468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.178468Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:61a68952c68778523abcd0815ac08cb76c2f41d5116baa58aa450734fcb26b44","observation_id":"04ea52e9-2045-47f9-9246-077abb6e75e4","resolution":{"observed_at":"2026-08-07T13:20:29.178468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15786","last_updated":"2024-10-17T02:43:35Z","snapshot_observed_at":"2026-08-03T10:43:35.890260Z","submitted_at":"2024-06-22T08:41:48Z","title":"What Matters in Transformers? Not All Attention is Needed","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15786","snapshot_observed_at":"2026-08-07T13:20:29.224634Z","title":"What matters in transformers? not all attention is needed, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.224634Z"},"links":{"cited_paper":"/paper/2406.15786","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:ba278332dc5a11a609e54c2c4e32c3bf5f34846f9b28c1d58429c83660ef61ce","observation_id":"f7e90854-c69a-4f0a-a85f-233c2ebb1f1e","resolution":{"observed_at":"2026-08-07T13:20:29.224634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:34.212356Z","title":"Query-key normal- ization for transformers","venue":null,"work_id":"7bf38bcd-6a90-47af-9f09-cb8784a560a9","year":2020},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.315730Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:7af7ae6fe98c8837feb80e2f8684c3d3ffc9b3da93ddb39ed3a72322d50b6575","observation_id":"fc3a4e75-a77d-4ce1-9059-a8989c4d24dd","resolution":{"observed_at":"2026-08-07T13:20:34.313400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T13:20:29.459790Z","title":"Hinton, Oriol Vinyals, and Jeffrey Dean","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.459790Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:8cdde2da4bc2dd1386ccdf4bd2035db671207d4302597615acd201cb68398e30","observation_id":"abe84c62-093f-46ab-8521-57e4a50b91b5","resolution":{"observed_at":"2026-08-07T13:20:29.459790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:33.925700Z","title":"Kakade, and Eran Malach","venue":null,"work_id":"a3f507f9-1bc8-4794-b2e2-efeabe327be9","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.576545Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:e00d50e60ba14cffde842ebc459625e95c631059d33b6bd6bda65a5bdf757af1","observation_id":"e47c749d-e5bd-42bd-983c-2e4954533252","resolution":{"observed_at":"2026-08-07T13:20:34.069698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:33.608749Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"5abfb312-989a-49a9-9b91-6c7cdd0c5915","year":2023},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.652714Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:d6fcb5feabd73c1dfc143e2f5b4d62d3f63625f6665fa0a513e674633dffde91","observation_id":"09b28262-294c-4137-b3e3-0ad36e27f9bb","resolution":{"observed_at":"2026-08-07T13:20:33.771256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-07T13:20:29.796292Z","title":"Jamba: A hybrid transformer-mamba language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.796292Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:e5e052b805b9bfad07acb2d79f2b7d2d82a66aa830b6193f568e998759c1eac5","observation_id":"75c86232-ff5e-4dd8-a5a0-b90bd121581f","resolution":{"observed_at":"2026-08-07T13:20:29.796292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:33.398543Z","title":"ZeroEval: A unified framework for evaluating language models, 2024","venue":null,"work_id":"02e7d309-2ec9-4cca-a996-fb067048e0b0","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.900421Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:c432632ad2dd00fbaa0a5e3ee2d50a7f4e4ad1d0c1303c4c8bd245e4d4548544","observation_id":"dda98709-d7ab-4e42-859f-828c0bf10a46","resolution":{"observed_at":"2026-08-07T13:20:33.495066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-04T14:58:56.675148Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-08-07T13:20:29.988143Z","title":"Longhorn: State space models are amortized online learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.988143Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:ccbd09771d20faa35f65e22642a68e44fd1aa0b50d5ebc08d9b0d58d7a8803fb","observation_id":"f53e4d36-c4fd-4546-b2f3-19cc08572a2b","resolution":{"observed_at":"2026-08-07T13:20:29.988143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:33.202428Z","title":"ShortGPT: Layers in large language models are more redundant than you expect, 2024","venue":null,"work_id":"e56127ef-f458-4508-86d3-4b35e736f60c","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.103410Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:f697f88f912b058668230d7acb5ae378b07a4c1820cf315827e19d839364bed3","observation_id":"9ad9e62b-be82-4353-ae17-d2abbba95ad4","resolution":{"observed_at":"2026-08-07T13:20:33.250157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:33.067593Z","title":"Are sixteen heads really better than one? In Advances in Neural Information Processing Systems, volume 32, 2019","venue":null,"work_id":"8f610f0c-2afa-4a78-bd86-293fd2d55243","year":2019},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.170022Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:553fdd0d6bfd3a7b32c43a3a49121454b3b9417c3cc6e6e59df00b5ef500a70c","observation_id":"889c22b1-ed36-471e-a1aa-f6dedd4dd1b1","resolution":{"observed_at":"2026-08-07T13:20:33.150611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14679","last_updated":"2024-11-04T17:36:38Z","snapshot_observed_at":"2026-08-08T01:30:40.012013Z","submitted_at":"2024-07-19T21:47:57Z","title":"Compact Language Models via Pruning and Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14679","snapshot_observed_at":"2026-08-07T13:20:30.255508Z","title":"Compact language models via pruning and knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.255508Z"},"links":{"cited_paper":"/paper/2407.14679","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:39d90554ac92c625af297087ee2969b2d2256e21d153a228f9fcedb9d805f72c","observation_id":"7f12d9e6-c704-420a-933c-0f6509bec4c7","resolution":{"observed_at":"2026-08-07T13:20:30.255508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.992962Z","title":"Bayesian Optimization: Open source constrained global optimization tool for Python, 2014–","venue":null,"work_id":"79b2b6e6-0a2d-40f4-8d14-dfc3dd6bad87","year":2014},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.313713Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:9564f5c7f4849be4d86717fc41f19ed237c0cdf765abc40bc3152b3643a0eee8","observation_id":"9ee686fd-fb30-4a8d-ae89-6a29e4acba5a","resolution":{"observed_at":"2026-08-07T13:20:33.044723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.895734Z","title":"Infinity instruct","venue":null,"work_id":"55bf1bbd-7756-4f12-8f96-b8aaeb744ec8","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.359409Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:d40aee4e3502ef1f9ae9efee0c3cd5a9b65c5a1507cf9269f5379a6226069294","observation_id":"d6b35deb-f0e0-445e-9e10-a7ed99dbd88e","resolution":{"observed_at":"2026-08-07T13:20:32.936382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-08-07T16:54:15.957609Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-07T13:20:30.438474Z","title":"Wind, Tianyi Wu, Daniel Wuttke, and Christian Zhou-Zheng","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.438474Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:ec51faf8e7fe9e1ff71ac5975a8e5f768c2b88314ab93838b3df2bd3c1f4ee5c","observation_id":"72ced6b8-b35b-453a-b537-264ad8ee29d0","resolution":{"observed_at":"2026-08-07T13:20:30.438474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-07T13:20:30.491759Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.491759Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:7eafde318ba936eb048630260537eb192c0e8109d1fe79b90473996ea1cb7c64","observation_id":"019756d4-33e6-40b8-8be0-e74ef74e8d78","resolution":{"observed_at":"2026-08-07T13:20:30.491759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-06T19:04:16.718797Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-07T13:20:30.608844Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.608844Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:d27a09d8c2d2eea5f70456584b394123c573d4ab4661c6690e3dbf66e9fc6b94","observation_id":"f1eaacc1-e7b1-4749-876b-ef971285a3f2","resolution":{"observed_at":"2026-08-07T13:20:30.608844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.822249Z","title":"TAID: Temporally adaptive interpo- lated distillation for efficient knowledge transfer in language models","venue":null,"work_id":"ea0f1f70-8122-487b-81a8-80c4dd956c99","year":2025},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.666488Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:7b6e6027af55cdc87e52130d57a51176063e26de494dfb76d93521c4a7d78d8d","observation_id":"cea3d994-b524-4a3b-b4c1-63a1a747d507","resolution":{"observed_at":"2026-08-07T13:20:32.852697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11912","last_updated":"2024-08-04T00:58:04Z","snapshot_observed_at":"2026-08-08T01:16:46.668747Z","submitted_at":"2024-04-18T05:25:54Z","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11912","snapshot_observed_at":"2026-08-07T13:20:30.755203Z","title":"Triforce: Lossless acceleration of long sequence generation with hierarchical speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.755203Z"},"links":{"cited_paper":"/paper/2404.11912","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:7971918d176a57e3bc39c4ba61c6b1dbd5e5dfc3affcf94d22b4b089a6aaa08c","observation_id":"ec1d226a-ee4e-4caa-8427-5d7dc4317c79","resolution":{"observed_at":"2026-08-07T13:20:30.755203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09298","last_updated":"2025-02-12T21:57:06Z","snapshot_observed_at":"2026-07-06T18:45:27.130369Z","submitted_at":"2024-07-12T14:31:05Z","title":"Transformer Layers as Painters","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09298","snapshot_observed_at":"2026-08-07T13:20:30.828566Z","title":"Transformer layers as painters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.828566Z"},"links":{"cited_paper":"/paper/2407.09298","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:868c0965274d86522042600afa5f44ac3f8e0aaf5358de923492df9729628c87","observation_id":"610db4f9-7003-4e02-a179-f5376252a4f0","resolution":{"observed_at":"2026-08-07T13:20:30.828566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.709260Z","title":"OpenHermes 2.5: An open dataset of synthetic data for generalist LLM assistants, 2023","venue":null,"work_id":"d034726b-6e6b-421d-a1d2-9c98ce2e384c","year":2023},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:30.967987Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:05c771d548a56d07678e57a9deb20490634d300efeb3b1d2db5d023d38d9aea4","observation_id":"ab900abb-5524-4b8b-8cf8-d262fa74d6a1","resolution":{"observed_at":"2026-08-07T13:20:32.764491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:31.059850Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.059850Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:c6862b2aace54c7feec6fd87ddafb1c521bb1d52960d58ac9bc1aad2c23306ed","observation_id":"b904818a-7db9-4b9f-9bc3-172616b79537","resolution":{"observed_at":"2026-08-07T13:20:31.059850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.590433Z","title":"Rush, and Tri Dao","venue":null,"work_id":"8052c825-826e-488a-9dff-778413ae9785","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.148458Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:cc2b764f3ed73eeee5b46af18f50d6cd5e6520f3caa82810fcbb5ebdefaae23e","observation_id":"663bb92a-f0a8-4a5e-95a5-02ed4cb3d922","resolution":{"observed_at":"2026-08-07T13:20:32.646348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.482160Z","title":null,"venue":null,"work_id":"33c0fb17-22a6-4ace-b3c2-f901c746af17","year":2025},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.282968Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:21e21da54b530bc890700a870f21c86c4f29573ff1a899f2fa2f4d4608b91298","observation_id":"35d6f519-5f1e-4140-8bb9-330f78d21323","resolution":{"observed_at":"2026-08-07T13:20:32.538808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.328412Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"410d633f-222f-4d99-b3a1-adadccc145ac","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.400726Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:e20479ba63e6a4e2813d540a91fe2e1510860f386d78205fd050bbaacc6caadc","observation_id":"03735d46-1613-48b5-970a-3f4fed6f6db8","resolution":{"observed_at":"2026-08-07T13:20:32.403849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.237326Z","title":"Gated delta networks: Improving Mamba2 with delta rule","venue":null,"work_id":"2422de7d-08d2-4a75-b2a9-be39a1e7f0ec","year":2025},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.483657Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:3abc9b9dd1590788b7245725514f5921ceedca79402d74ebce02cc5711f00dc4","observation_id":"1aa69c5a-6049-4b7c-bf0f-4ca029f51e12","resolution":{"observed_at":"2026-08-07T13:20:32.287914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:32.097595Z","title":"KV cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches","venue":null,"work_id":"f83cf3fb-57cd-4311-9bf5-78fe32453fa7","year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.572565Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:7595779a2b81902ac035a042dfcbde9fcad834cbbe09461f6f26d17d33255dfd","observation_id":"f5f05cd6-5fe4-4479-b4c4-e5edecafde18","resolution":{"observed_at":"2026-08-07T13:20:32.147055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:31.661089Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.661089Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:377c15821bd0750b20f56db889e4bb6077d7fe2359a59a4c5919c05d75ff4f0c","observation_id":"893308ac-ba7d-42ad-97ec-976addc14d2c","resolution":{"observed_at":"2026-08-07T13:20:31.661089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08168","last_updated":"2024-05-20T02:37:20Z","snapshot_observed_at":"2026-07-06T16:18:49.258642Z","submitted_at":"2023-09-15T05:34:32Z","title":"Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08168","snapshot_observed_at":"2026-08-07T13:20:31.702035Z","title":"w/ Mamba","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:31.702035Z"},"links":{"cited_paper":"/paper/2309.08168","citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:3b891172860a45aea4f4e1bc2efcc638291c95445a7c939610299268e6638007","observation_id":"2bdbaa1d-2463-486a-abd3-f3156652c70c","resolution":{"observed_at":"2026-08-07T13:20:31.702035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:35.150981Z","title":null,"venue":null,"work_id":"fcf963fe-8921-4212-b397-7f94588f8a78","year":2020},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":398,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:28.145383Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:d2de9ad5ef749ee68de41dd14f6ca7cdc324285df31e3a2c7d64855c0927e3e9","observation_id":"06fca4ef-0e7b-4b0e-b5cd-da60bcd63155","resolution":{"observed_at":"2026-08-07T13:20:35.277833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:26.876727Z","title":"doi: 10.18653/v1/2024.acl-long.172","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:26.876727Z"},"links":{"citing_paper":"/paper/2505.22135"},"observation_digest":"sha256:5b3c5cc8b3b982f6764832edb43e67d152c643b1e840a5268059504cc2d50c43","observation_id":"b9a285ad-0920-4b57-a372-21208309bb95","resolution":{"observed_at":"2026-08-07T13:20:26.876727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22135","last_updated":"2025-05-28T08:59:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:17:33.511635Z","submitted_at":"2025-05-28T08:59:02Z","title":"RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 4 inbound Pith citation observations for arXiv:2505.22135."}