{"as_of":"2026-08-22T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62993f9cb8485fabebc3258bc7d85485f86b70e70b3d7b2421d19114032f1141","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:12:43.543963Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.11667/citation-record","integrity":"/paper/2601.11667/integrity","json":"/paper/2601.11667/citation-record.json","paper":"/paper/2601.11667"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.345860Z","title":"In: The Twelfth International Conference on Learning Representations (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.345860Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:61187b7e38a6dfd8fe24bb6548d4c307d58d1b2ca2e92366fdb6e1a4887d3581","observation_id":"9939c326-9843-4f7b-a660-cf4f5510c14b","resolution":{"observed_at":"2026-08-03T10:12:43.345860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.351039Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.351039Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:256814108f8218bb78b8cd8f2e988c159a59b117e7bb88ee8968c2c7a19d84db","observation_id":"83dbf5ec-36f6-4e52-aa00-6738cc2da73a","resolution":{"observed_at":"2026-08-03T10:12:43.351039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-08-16T14:14:23.399336Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-03T10:12:43.355457Z","title":"arXiv preprint arXiv:2402.18668 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.355457Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:e4591ad21dc90a5f0494785c38607e780af4beb929e15ac2c57b9398da6f555e","observation_id":"01268683-7886-4eda-a5f5-cd34d926812d","resolution":{"observed_at":"2026-08-03T10:12:43.355457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19146","last_updated":"2025-06-03T12:02:03Z","snapshot_observed_at":"2026-08-17T14:28:16.308225Z","submitted_at":"2024-11-28T13:45:42Z","title":"Puzzle: Distillation-Based NAS for Inference-Optimized LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19146","snapshot_observed_at":"2026-08-03T10:12:43.360476Z","title":"arXiv preprint arXiv:2411.19146 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.360476Z"},"links":{"cited_paper":"/paper/2411.19146","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:74552d791594992ae1423d6f53813cee6d86f4e6bcedd2ee352c73a6cee5dcb2","observation_id":"b6365257-6226-447a-9376-12747f3a27d5","resolution":{"observed_at":"2026-08-03T10:12:43.360476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.365325Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.365325Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:c27cfa019601fb5a9b01bfb22ae1d78b36536ad450e234be667286653215059f","observation_id":"f0da1e75-c7fc-4144-bb0e-701f648bfd7c","resolution":{"observed_at":"2026-08-03T10:12:43.365325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.369522Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.369522Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:5302cc2d27e10e2cd27b285ce1d7ba86831f19114a563c21dea029a3b7c83839","observation_id":"aa946a11-5e96-4997-b81e-b28625c0383c","resolution":{"observed_at":"2026-08-03T10:12:43.369522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03398","last_updated":"2024-12-04T15:27:39Z","snapshot_observed_at":"2026-08-13T13:38:24.401357Z","submitted_at":"2024-12-04T15:27:39Z","title":"RedStone: Curating General, Code, Math, and QA Data for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03398","snapshot_observed_at":"2026-08-03T10:12:43.374331Z","title":"arXiv preprint arXiv:2412.03398 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.374331Z"},"links":{"cited_paper":"/paper/2412.03398","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:a0155994cf8b49f73d6dee8b4c94cf00b65e3a4436e738862cdaac5e5396c2ae","observation_id":"4e25b861-2189-4b9e-af16-fddbf105c99b","resolution":{"observed_at":"2026-08-03T10:12:43.374331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-03T10:12:43.378888Z","title":"arXiv preprint arXiv:2009.14794 (2020)","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.378888Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:f612c54495836ebfcd7175adf62ef6816a0c27e9e64bb5296058ab4cb198b254","observation_id":"e00612ed-0e6c-440d-bc14-2b1cdef265d3","resolution":{"observed_at":"2026-08-03T10:12:43.378888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-17T14:44:42.060038Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-03T10:12:43.383254Z","title":"arXiv preprint arXiv:1905.10044 (2019)","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.383254Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:ab6781f98eb9a791a89c4fecdc7e93f1793e513e705fe5564493a668854ae061","observation_id":"64ff5a9f-82b7-4e10-8680-4db629eecbaa","resolution":{"observed_at":"2026-08-03T10:12:43.383254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-03T10:12:43.387794Z","title":"arXiv preprint arXiv:1803.05457 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.387794Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:471df66a0b4a36f799dafb043efac488eeb80f64ad3e1414f1c271dc0ad9fe27","observation_id":"c2154892-0075-4504-b8b8-c3467b16bc07","resolution":{"observed_at":"2026-08-03T10:12:43.387794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-03T10:12:43.392306Z","title":"arXiv preprint arXiv:2405.21060 (2024) 14 Xiaojie Xia, Huigang Zhang, Chaoliang Zhong, Jun Sun, and Yusuke Oishi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.392306Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:248f03f7cc0fdf8f6ad01588fb477787d07b3c41faf810ca6769529b2e788ced","observation_id":"787a1d5f-9d73-4b53-8e68-3181dc142f69","resolution":{"observed_at":"2026-08-03T10:12:43.392306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-08-20T11:13:49.127921Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-03T10:12:43.396788Z","title":"arXiv preprint arXiv:2402.19427 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.396788Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:1bbadc42e9e1efc0ee27c81901d66b736bcece3c47f607395566b002819398fb","observation_id":"3b83e026-48db-4285-9fa0-0126f68688f8","resolution":{"observed_at":"2026-08-03T10:12:43.396788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-08-18T19:17:21.619873Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-08-03T10:12:43.401295Z","title":"arXiv preprint arXiv:2212.14052 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.401295Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:f95882fdb83a0abf46f54f5ffc5f694926f64f9bc639eb66e06c607ea176f7fb","observation_id":"9713c075-5dae-4284-ab4f-ec61593245cf","resolution":{"observed_at":"2026-08-03T10:12:43.401295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.405519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.405519Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:2366a2a763717d548ee968d901871f73457a08a6328e1e525d03d68594e41f75","observation_id":"f16cecf3-e5e5-4797-8bc5-77fa2237daa9","resolution":{"observed_at":"2026-08-03T10:12:43.405519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-08-18T10:18:01.875999Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-03T10:12:43.409911Z","title":"arXiv preprint arXiv:2405.16712 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.409911Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:ca72b091d0142ca55f0b6ab9fa5c98138c3adc718be6e8756c886b7752bdffd4","observation_id":"3d9adff0-c827-411b-ac9a-e6e1f308b286","resolution":{"observed_at":"2026-08-03T10:12:43.409911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.414088Z","title":"arXiv preprint arXiv:2505.03005 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.414088Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:2b7326221375b3d4933b8a3291ca07728e5ec51206f49599532eecd5e3a79fab","observation_id":"c528d24b-7139-438a-a721-e83a0025aef1","resolution":{"observed_at":"2026-08-03T10:12:43.414088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T10:12:43.418382Z","title":"arXiv preprint arXiv:2407.21783 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.418382Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:ea00d065b79ea809f6db5e7cd393f8bfde34bd142a3f71317fa12ec8e0f80fb2","observation_id":"51b282e8-2d62-4ea3-8520-128154bdb4cf","resolution":{"observed_at":"2026-08-03T10:12:43.418382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.422336Z","title":"In: First conference on language modeling (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.422336Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:d311783e3f651aca0a6644604897697dde82f4de15475b6b0f18807e33e7e30c","observation_id":"ae71b19d-8de1-4365-9848-55b64eaad903","resolution":{"observed_at":"2026-08-03T10:12:43.422336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-03T10:12:43.426586Z","title":"arXiv preprint arXiv:2111.00396 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.426586Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:85712cc6399b5ce9325ef53c04de5f6f93088b4426d7c01e921d7515f4310628","observation_id":"e159d1bc-d9c2-4792-beb8-aa641cb3b396","resolution":{"observed_at":"2026-08-03T10:12:43.426586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-16T00:37:04.298248Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-03T10:12:43.431249Z","title":"arXiv preprint arXiv:2306.08543 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.431249Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:8df7b526a6ca48a8ad921877c056f56963be0256ec02815269092fb8803c6d48","observation_id":"edb01a16-d2eb-4b17-8eb2-731d22d5d43d","resolution":{"observed_at":"2026-08-03T10:12:43.431249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.435815Z","title":"arXiv preprint arXiv:2508.15884 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.435815Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:381171dfa27da29e732322a8f2b9a13661a8ca7fc90f69ced3d9bf50434c1726","observation_id":"9fe6b860-e05b-44c4-939d-b89709c34735","resolution":{"observed_at":"2026-08-03T10:12:43.435815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-03T10:12:43.440147Z","title":"arXiv preprint arXiv:2009.03300 (2020)","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.440147Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:f960ceeec3362aa79621f727548c7578c86346a2e395c6cc02aaf9a06e4d8d4c","observation_id":"ee59e748-61b2-47b7-bbc4-053839412456","resolution":{"observed_at":"2026-08-03T10:12:43.440147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-03T10:12:43.444487Z","title":"arXiv preprint arXiv:1503.02531 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.444487Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:3967e2938d0417ecdd4ef0d6cf054faf5a5b0260a557a16662e2844eff6152b2","observation_id":"3e6529c1-2b5a-4b92-90ff-e982a49a944e","resolution":{"observed_at":"2026-08-03T10:12:43.444487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.448994Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.448994Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:58f42aad02de030d4abf412d9cb9b482c9646a2972d9078464b39a4920fb1b24","observation_id":"cdd3e326-b7e8-4b66-8cf7-3ecfbc670b79","resolution":{"observed_at":"2026-08-03T10:12:43.448994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.452989Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.452989Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:37e26b4922353694e43a674983cca9b62b9303adfb4d67601e68e7fd850a6eb7","observation_id":"dc74a54a-7e33-441a-9ed8-cb54d105c41a","resolution":{"observed_at":"2026-08-03T10:12:43.452989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.457087Z","title":"In: The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.457087Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:8e8e45d01e940d18cd25520762905be41a21f76bec51b96c46b92e6404b710b3","observation_id":"700e8b2b-a30a-4ed1-b2d9-666830b97d18","resolution":{"observed_at":"2026-08-03T10:12:43.457087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13299","last_updated":"2025-07-08T06:24:53Z","snapshot_observed_at":"2026-08-16T12:49:18.246154Z","submitted_at":"2025-03-17T15:44:09Z","title":"A Survey on Transformer Context Extension: Approaches and Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13299","snapshot_observed_at":"2026-08-03T10:12:43.461332Z","title":"arXiv preprint arXiv:2503.13299 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.461332Z"},"links":{"cited_paper":"/paper/2503.13299","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:7905a1432a506aaa9e25d3cdc0c94e0005668f2bdf29de19064fb932964c80ec","observation_id":"41fb7ac7-b54e-4f7f-833a-4fb8e6723a0e","resolution":{"observed_at":"2026-08-03T10:12:43.461332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-03T10:12:43.466281Z","title":"arXiv preprint arXiv:1809.02789 (2018) Efficient Task-Specific Hybrid Attention Model Construction 15","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.466281Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:bf691c933e2d76c98d62e92f7ae1c2011e0f0c563912e84b751e33d9914608c2","observation_id":"536c4b9f-5864-47ad-91e3-23af9f0dfd23","resolution":{"observed_at":"2026-08-03T10:12:43.466281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-03T10:12:43.470745Z","title":"arXiv preprint arXiv:2305.13048 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.470745Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:7fe9cd01b6f8da9b42482ca199c3bf0fa2e4962762d40d9f5c4e2e2468291ab5","observation_id":"66e45c99-c107-496d-a49b-00dad54ae26a","resolution":{"observed_at":"2026-08-03T10:12:43.470745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01129","last_updated":"2026-04-06T02:10:55Z","snapshot_observed_at":"2026-08-11T00:37:21.988846Z","submitted_at":"2024-08-02T09:18:41Z","title":"A Survey of Mamba","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01129","snapshot_observed_at":"2026-08-03T10:12:43.475185Z","title":"arXiv preprint arXiv:2408.01129 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.475185Z"},"links":{"cited_paper":"/paper/2408.01129","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:d6493ddf97379ffdafe6da645ed0bff369d5ca56490a2e2de182d1dd6f0c978e","observation_id":"cee4a1bb-6511-4104-8d85-f76dbe1412aa","resolution":{"observed_at":"2026-08-03T10:12:43.475185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-16T13:44:03.977685Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-03T10:12:43.479932Z","title":"arXiv preprint arXiv:2406.07522 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.479932Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:54b5d904151446e4ff0e2e22d20327712cc41d964cd955c8ec315b9029ee600b","observation_id":"068276b2-d6b2-49bf-a359-2c27da520928","resolution":{"observed_at":"2026-08-03T10:12:43.479932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.484197Z","title":"Communications of the ACM64(9), 99–106 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.484197Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:9a38f54375f8b0b10a4d5b6f0545fd70cc17071d72bd515962b681e0ccab8d56","observation_id":"744f92e5-3cbb-4136-a17c-6b02136bafca","resolution":{"observed_at":"2026-08-03T10:12:43.484197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.488370Z","title":"In: Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.488370Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:5deb5c0e3a2bb0e2f15e0b2811cdfaa46d97d4b5ded80951eb9cc1a529c7b880","observation_id":"5d386163-bc91-4fd5-aefa-a80ed141055f","resolution":{"observed_at":"2026-08-03T10:12:43.488370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-03T10:12:43.492542Z","title":"arXiv preprint arXiv:2307.08621 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.492542Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:5cf727bf6916679fde5c2786cc1030eb35020377722767b5911904e17f02ab7a","observation_id":"7a8851e8-d327-4e72-8585-21cc8ad72d4d","resolution":{"observed_at":"2026-08-03T10:12:43.492542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.497616Z","title":"In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.497616Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:55cdcf821b047166e13a99d339eedd0fa87410d51cd3fab9cc9af1ef94166605","observation_id":"bf4ca54e-a0d6-480a-9282-6511ebd87d9a","resolution":{"observed_at":"2026-08-03T10:12:43.497616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05964","last_updated":"2024-04-07T13:03:58Z","snapshot_observed_at":"2026-08-18T13:11:45.136886Z","submitted_at":"2024-02-05T12:16:28Z","title":"A Survey on Transformer Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05964","snapshot_observed_at":"2026-08-03T10:12:43.502045Z","title":"arXiv preprint arXiv:2402.05964 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.502045Z"},"links":{"cited_paper":"/paper/2402.05964","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:f07987e21fb70c5a07060163a0a1aedc1d003deb73a00e2a0954461c4d52dea8","observation_id":"e89911bd-6ab5-478a-8be7-90820dc3534d","resolution":{"observed_at":"2026-08-03T10:12:43.502045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-03T10:12:43.506901Z","title":"arXiv preprint arXiv:2407.106712(3) (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.506901Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:c93ad266a2c8e50f539d0a5a58bbfc6865dd155cb955a5743d660ff4999c5d83","observation_id":"9534b521-4957-47ad-ab9b-61e42f1f6a7b","resolution":{"observed_at":"2026-08-03T10:12:43.506901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.511668Z","title":"Advances in neural information processing systems30(1), 261–272 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.511668Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:9dbe43102ae08378f30f72b97c38b502ca6d10300b1afd808215c676b8332444","observation_id":"073235d7-9b2a-43f2-85b5-711787578248","resolution":{"observed_at":"2026-08-03T10:12:43.511668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-03T10:12:43.516117Z","title":"arXiv preprint arXiv:2406.07887 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.516117Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:14681e4903f73801f976230b9aa8de801f9378170d065cfb89b59ba193f92913","observation_id":"ec7f5ff8-52bd-45ba-bbde-d32e82a7d91b","resolution":{"observed_at":"2026-08-03T10:12:43.516117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-08-14T00:11:56.379317Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06457","snapshot_observed_at":"2026-08-03T10:12:43.520679Z","title":"arXiv preprint arXiv:2507.06457 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.520679Z"},"links":{"cited_paper":"/paper/2507.06457","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:8e070517313653a752e93c52676e20a2eb27d87b01deb91de97039806bcc609c","observation_id":"0117f594-6d54-4f2b-a2cf-4af73fa36246","resolution":{"observed_at":"2026-08-03T10:12:43.520679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.525308Z","title":"Advances in Neural Information Processing Systems37, 62432–62457 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.525308Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:e4f034332e80fc467ca21491c38c5346907dd820442eafa1758d7edc0eac9789","observation_id":"894df4eb-a66b-485e-9b74-10a784177146","resolution":{"observed_at":"2026-08-03T10:12:43.525308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-17T19:08:01.495561Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-03T10:12:43.529744Z","title":"arXiv preprint arXiv:1707.06209 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.529744Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:579a512f449df86cb07ad1a1c21238a8343a013392c0a4cdd6ab8686ee9fb174","observation_id":"cc553eca-d13c-4844-aba5-a0d6a18677c8","resolution":{"observed_at":"2026-08-03T10:12:43.529744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.534167Z","title":"arXiv preprint arXiv:2505.17272 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.534167Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:78f9b2af71b04f4a7a6ba45ad65e15fb91e6b5563bc113fc8f112edd3e88ac0c","observation_id":"0d705e04-0142-4c32-82e3-9a51c9687088","resolution":{"observed_at":"2026-08-03T10:12:43.534167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-14T21:08:22.323819Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-03T10:12:43.538784Z","title":"arXiv preprint arXiv:2412.06464 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.538784Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:16f951b46e30778aa4afe8f5d5ab168b77f3bd3a77e34954b967fdb12995a4be","observation_id":"5ffae1b9-8788-42fc-a335-8b19b7fb8773","resolution":{"observed_at":"2026-08-03T10:12:43.538784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:12:43.543963Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T10:12:43.543963Z"},"links":{"citing_paper":"/paper/2601.11667"},"observation_digest":"sha256:d226515a740a5be5b7a9d0269dec38c71ba1688c863b5d8a7ee8732a7dee3bcb","observation_id":"9e99d2c7-d130-441b-a041-22320f460592","resolution":{"observed_at":"2026-08-03T10:12:43.543963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.11667","last_updated":"2026-06-02T03:42:50Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T08:24:55.584817Z","submitted_at":"2026-01-16T02:01:40Z","title":"Distill-then-Replace: Efficient Task-Specific Hybrid Attention Model Construction"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2601.11667."}