{"as_of":"2026-08-09T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00c6f22e67a7c28d6ddc13ab9431c89921324c026bfb1139c19eb4c3921bfd55","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:44:00.720633Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07832/citation-record","integrity":"/paper/2502.07832/integrity","json":"/paper/2502.07832/citation-record.json","paper":"/paper/2502.07832"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-08T13:44:00.394550Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.394550Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:5d029978bab937edcec92914ec20243c3d8e5a3cfd43cf054a870edebd984fb6","observation_id":"609a0388-61f5-4d4f-8bab-334ba9f061f7","resolution":{"observed_at":"2026-08-08T13:44:00.394550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.399688Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.399688Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:68946bdc6ff71b49f8d475e91b4f6adb9d32dbafafeaa707adb4493a366a5314","observation_id":"f78eda28-a31b-4362-9066-1676b007fe72","resolution":{"observed_at":"2026-08-08T13:44:00.399688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.403441Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.403441Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ebb8ec27718c11802f57ead225387dd819a501d82face1a56e965e28978ef1b6","observation_id":"ad89bf29-a54e-4554-993e-c2a38d02cae8","resolution":{"observed_at":"2026-08-08T13:44:00.403441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-08T13:44:00.407280Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.407280Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:2a4643e90bf498eb461ac10b8b5277aa1a23e480bdd8ae28b7c96cdfc430f93e","observation_id":"4c65fb43-6d32-422b-b5f5-f7e98e5c1f8b","resolution":{"observed_at":"2026-08-08T13:44:00.407280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.411395Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.411395Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c36c8620f72712b727af5020e841eba913241515cd666fc4c18182ece2f97ae0","observation_id":"5219e199-9660-4a5e-ba13-6eda36712582","resolution":{"observed_at":"2026-08-08T13:44:00.411395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.415307Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.415307Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:18704fe65bbe08841c18ca2d91623f9f3514fd10b73171362d9e781235a385f5","observation_id":"adf91926-3d4f-4a60-a854-f1f9a93f7d7b","resolution":{"observed_at":"2026-08-08T13:44:00.415307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-08T13:44:00.419177Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.419177Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3bdf95953161503def38ef7c3d880b442a5787782eb071f690e622e06fdeba0b","observation_id":"cc9c7778-8471-48d6-ac99-e2e7b0a8d294","resolution":{"observed_at":"2026-08-08T13:44:00.419177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T13:44:00.422737Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.422737Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:8883bff4cbe0807da7b33de1db6a37bbdc63fdf91a9a460c353c0b303cd44c05","observation_id":"2fa7b9b5-d346-44e6-a89f-9ac1bcf1e561","resolution":{"observed_at":"2026-08-08T13:44:00.422737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-08T13:44:00.426468Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.426468Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:553d467fd60d3b310a4b6619be85a28973cb2ee2e5296f11105d5a14e0b3b880","observation_id":"33217203-abf2-4e99-9754-d8f3a24df587","resolution":{"observed_at":"2026-08-08T13:44:00.426468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.429889Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.429889Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:254ebe66995602a846045d08669b9e3b753d502eda63bf95c283b68387956f05","observation_id":"99af52a5-86ed-477c-97da-3b0ec35d1cdc","resolution":{"observed_at":"2026-08-08T13:44:00.429889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.433149Z","title":"Learning to maximize mutual information for chain-of-thought distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.433149Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:322802c9702f0cd0cf7e76ec45856b5848d78d956704486702bb527858a3e64b","observation_id":"ac8a45f6-28b3-4949-b2bd-0700b1623bde","resolution":{"observed_at":"2026-08-08T13:44:00.433149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-07-06T16:21:57.649550Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-08T13:44:00.436326Z","title":"Longlora: Efficient fine-tuning of long-context large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.436326Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6cd14281f0ad5579bf26cede3faab5539ff26cedc80f8f0d8ca54804a954423f","observation_id":"e4d976e9-10fa-47c7-b95f-0791502939b2","resolution":{"observed_at":"2026-08-08T13:44:00.436326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.439774Z","title":"D ialog S um: A real-life scenario dialogue summarization dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.439774Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:80274b03fb83e33b94ddda8356068d110005c7fac582584a1b0938cab0be5d48","observation_id":"0dda9464-5803-46e1-828d-e2c8405ddf5c","resolution":{"observed_at":"2026-08-08T13:44:00.439774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.442950Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.442950Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:275a86d73965da541d95f37ad114ba29e19c93d6295788603193a3ba913771b1","observation_id":"dca0e07c-86e1-4425-bf77-755de8711dbe","resolution":{"observed_at":"2026-08-08T13:44:00.442950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.445935Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.445935Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:394f8c4f63bd471c76f4d1c7b9fd962f5b82fb4dd25ef0e6e78cda1434c43527","observation_id":"af5fd9e9-6e76-4b30-9820-56d76ac01d54","resolution":{"observed_at":"2026-08-08T13:44:00.445935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T13:44:00.448983Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.448983Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:fa159dd2579942ffbeb3c0a0aadc307f245a483f08a634ffca261d60f20d8501","observation_id":"76976001-ca3e-4cc4-8e76-993290329eff","resolution":{"observed_at":"2026-08-08T13:44:00.448983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T13:44:00.452482Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.452482Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:f1765d9fb44a5c2224b5acb8ee0da5eb0bd2dbb902ecd9399a799fb78d568f4f","observation_id":"384bbdd8-c598-4cc6-8732-558b9d69691f","resolution":{"observed_at":"2026-08-08T13:44:00.452482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.456036Z","title":"Free dolly: Introducing the world's first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.456036Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9c501aaa340141a408f991f659d6d0dcdf6f10f1d295e9139b13c5e51f60e41a","observation_id":"55dcea1e-fcb7-4a65-85bc-ba36521e10a9","resolution":{"observed_at":"2026-08-08T13:44:00.456036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.459132Z","title":"Mutual: A dataset for multi-turn dialogue reasoning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.459132Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:f8c73f9456d8292749837de1cbb542cbbdca2442a2f8ae2c10109245e1831f31","observation_id":"5144d1d7-b9ea-43d0-b3b9-ac95b4ea587f","resolution":{"observed_at":"2026-08-08T13:44:00.459132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-08T13:44:00.462157Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.462157Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:514c057eccefdc3ef38bc74e776a3b5f7e4b8dbc2ed64db05482ad9279be5245","observation_id":"f4f976b7-223a-4a05-98af-bec7aced9cd8","resolution":{"observed_at":"2026-08-08T13:44:00.462157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.465407Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.465407Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:06517bedce52862765da6ba15ca87b679cddd93440c9e4ea72240d1f0c1b8ede","observation_id":"cd351f96-3ef2-4134-8c23-5cb350db3938","resolution":{"observed_at":"2026-08-08T13:44:00.465407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.468388Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.468388Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ed6c12be51b2e23a106a3690d22f3881fcfdb4d20934c9096cba3083f9c988e4","observation_id":"d2947059-ec14-420b-b640-69bc0a070c9d","resolution":{"observed_at":"2026-08-08T13:44:00.468388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.471354Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.471354Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7b70b4ad0dc602210338d3fc16aef9ebf4ba8dcecbf58ccecf5cf47ea0778449","observation_id":"f04ece8a-781a-4cf6-981a-a8cf6b514c72","resolution":{"observed_at":"2026-08-08T13:44:00.471354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-07-06T15:13:02.077291Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-08T13:44:00.474327Z","title":"Cerebras-gpt: Open compute-optimal language models trained on the cerebras wafer-scale cluster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.474327Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:d81eefc8779564f20215f084ecf61ff33faa2d6a9469fd5e6aef9c3ee585f880","observation_id":"8d69a650-a8bd-4bfe-bada-f1598e01d261","resolution":{"observed_at":"2026-08-08T13:44:00.474327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.477757Z","title":"Blockwise compression of transformer-based models without retraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.477757Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e3140db10490497947e66ef5adb1e887a9123c3d514ecac5f733a95cf0224e4f","observation_id":"9bb8c23d-e8c0-4e2b-bae4-dbe1d46a9d9a","resolution":{"observed_at":"2026-08-08T13:44:00.477757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T13:44:00.480714Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.480714Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6fec887794aba79c572edf3a3f7021e4c7c82c6503652b3df5a703ae8261be18","observation_id":"6d9b0a07-1127-4b4f-8b2b-b5fab7e721f3","resolution":{"observed_at":"2026-08-08T13:44:00.480714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.483877Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.483877Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7a499827d29dadec029408b254632becc256a41ffa4bb4e0110de7656f2d0723","observation_id":"d1547bb2-eb02-4cf9-ad61-c92ecfa99937","resolution":{"observed_at":"2026-08-08T13:44:00.483877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-08T13:44:00.486906Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.486906Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ceafcbc5b989bbea2afe969b16bc3e283fad17aa6f191787d894c1622b8c4abe","observation_id":"9373bec1-19a2-4e7b-855b-716f523cf8a0","resolution":{"observed_at":"2026-08-08T13:44:00.486906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.489949Z","title":"Learn-to-share: A hardware-friendly transfer learning framework exploiting computation and parameter sharing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.489949Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ca3fb9cb94261c15f76fd57b64546cd6496bd019bc29e85ce89ad70e625b4017","observation_id":"d554e6de-e130-4979-a77b-ffaab0f0b5f7","resolution":{"observed_at":"2026-08-08T13:44:00.489949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.492841Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.492841Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b5cd631ac7b562f0aee2f469812036893fba90898d6d6f4b72c0835ca41691d8","observation_id":"f77d0b6a-ef8e-45b7-aa1e-c0768c072392","resolution":{"observed_at":"2026-08-08T13:44:00.492841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-08T13:44:00.495709Z","title":"The unreasonable ineffectiveness of the deeper layers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.495709Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7b6c7561d4531878e08a7d9579e1469962d7cae2c5774ed89a7f9d0c43611748","observation_id":"a2a0077f-9906-4d40-a7c2-332cf89e403b","resolution":{"observed_at":"2026-08-08T13:44:00.495709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-08T13:44:00.498897Z","title":"Textbooks are all you need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.498897Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:86ffaf4b59274b15c68710f919784f7f059e304267cc20c37dc4aeff586cd4b5","observation_id":"990270c8-cd96-4223-a541-89660cfc90ba","resolution":{"observed_at":"2026-08-08T13:44:00.498897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.502449Z","title":"Compressing pre-trained language models using progressive low rank decomposition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.502449Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6326eb1127b9d9c61d073fc7c0ab4737e36951c7383bb22378d8db8726668763","observation_id":"126127a4-5cba-4546-9584-de4734c56e1e","resolution":{"observed_at":"2026-08-08T13:44:00.502449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-08T13:44:00.505557Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.505557Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:4eddbab6f4c49c4e112a489c37743bc48055b7d0af3a4c681af9c2f88c134954","observation_id":"1bdf172f-4dc9-4564-81cb-d56f9a209242","resolution":{"observed_at":"2026-08-08T13:44:00.505557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-08T13:44:00.508785Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.508785Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3a9c3db948c9a50be86cc668546c7891100a642b1be13bc1f2c5de6b5e94bb4c","observation_id":"b740735b-53ed-46ac-8c77-911256352e1a","resolution":{"observed_at":"2026-08-08T13:44:00.508785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00112","last_updated":"2022-06-30T21:57:07Z","snapshot_observed_at":"2026-07-06T13:26:38.135401Z","submitted_at":"2022-06-30T21:57:07Z","title":"Language model compression with weighted low-rank factorization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00112","snapshot_observed_at":"2026-08-08T13:44:00.512142Z","title":"Language model compression with weighted low-rank factorization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.512142Z"},"links":{"cited_paper":"/paper/2207.00112","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:05f0a3f203d0adf5df047d915eb45796eb89deda243f264945d39229adeb32f4","observation_id":"24872e0f-5eed-430f-a35c-01ad60f58d30","resolution":{"observed_at":"2026-08-08T13:44:00.512142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T13:44:00.515423Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.515423Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:d11087a2515fbe681dcdd790f1d538d875344752430a295cef2e06f8215f76e9","observation_id":"2eae92fb-3812-48f7-b5b7-4b9ef31c70f8","resolution":{"observed_at":"2026-08-08T13:44:00.515423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-08T13:44:00.518499Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.518499Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:42e43b63abefc66aa23b062e488586a1e4916cd09e55fc7be6802fb81a9f907f","observation_id":"ec55e8c8-09c2-491b-bdac-9477daf7f5fe","resolution":{"observed_at":"2026-08-08T13:44:00.518499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.521757Z","title":"safetensors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.521757Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:f23bf5f77fd59edc8890c2f50dd5fe45ab9fc01363b8ffb44fae2ea027d648bb","observation_id":"d397db10-374b-451a-a7ef-ff47182143d8","resolution":{"observed_at":"2026-08-08T13:44:00.521757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-09T03:30:59.643714Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-08T13:44:00.524776Z","title":"Camels in a changing climate: Enhancing lm adaptation with tulu 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.524776Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:4c8ad618f6eb559e40a3a5f6e991b2b6f45efc1188121b23152630da42d6a086","observation_id":"9bebc7d0-9c82-473a-8ad4-c3ac6329add6","resolution":{"observed_at":"2026-08-08T13:44:00.524776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T13:44:00.528254Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.528254Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c4c42121eefae0d8e450ff76d2a836195a5bb5f1ca2eef432c2e334fdbb1b95f","observation_id":"dbea67cc-d6dc-4143-8b6c-4fdf9f4d9c7c","resolution":{"observed_at":"2026-08-08T13:44:00.528254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02692","last_updated":"2021-02-12T07:30:17Z","snapshot_observed_at":"2026-07-06T08:35:17.887292Z","submitted_at":"2019-11-07T00:54:06Z","title":"Multi-Domain Neural Machine Translation with Word-Level Adaptive Layer-wise Domain Mixing","version":3},"cited_work":{"arxiv_id":"1911.02692","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.02692","snapshot_observed_at":"2026-08-08T13:44:01.004246Z","title":"Multi-Domain Neural Machine Translation with Word-Level Adaptive Layer-wise Domain Mixing","venue":"cs.CL","work_id":"6f3cfe1d-f104-4bb1-94f7-c449e94c6a22","year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.531798Z"},"links":{"cited_paper":"/paper/1911.02692","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:92a21791da4dcfefbaac3513fcc162b3f70413a246c91c446cc256cb567fbbe5","observation_id":"1146dde1-570b-456e-b301-574fa10fb48e","resolution":{"observed_at":"2026-08-08T13:44:01.008160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.535267Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.535267Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9c74ed9c2da2ff312a5d5f0df938519e067df16ce9117bd29bc738e323c7c3b4","observation_id":"d05d8b5b-34a8-4366-8d4e-c58a586a8720","resolution":{"observed_at":"2026-08-08T13:44:00.535267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-08T13:44:00.538291Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.538291Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:5edd308ebbc0f0bc83ac28cf152d548b650973603ec658269afa59749fc41281","observation_id":"0872bdf5-f05e-4ce2-b24d-f984a37244e5","resolution":{"observed_at":"2026-08-08T13:44:00.538291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.566062Z","title":"arxiv-math-instruct-50","venue":null,"work_id":"5128a17f-e1cd-4925-9db9-41bda8d12a14","year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.541523Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:10822dc2adb6f2b57d8487530f4676cfa0de960814b7f2a263d3bf3701131201","observation_id":"df2d3abd-ca64-4747-977d-7f5f91b1e126","resolution":{"observed_at":"2026-08-08T13:44:01.569680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-08T13:44:00.544467Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.544467Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e3a4b66ada89b80c81677b46c565bf15b45fad882d5a26b1a5fda300070ac737","observation_id":"82fa24fe-d6f5-4e80-a3b1-bf4e25e3196a","resolution":{"observed_at":"2026-08-08T13:44:00.544467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14017","last_updated":"2023-02-27T18:18:13Z","snapshot_observed_at":"2026-08-07T20:46:33.578633Z","submitted_at":"2023-02-27T18:18:13Z","title":"Full Stack Optimization of Transformer Inference: a Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14017","snapshot_observed_at":"2026-08-08T13:44:00.547913Z","title":"Full stack optimization of transformer inference: a survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.547913Z"},"links":{"cited_paper":"/paper/2302.14017","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:8d583487d4e790bfa5cda2b137a572143e10f713f04207a99910622251d7c96d","observation_id":"1dce0f8e-e1f0-4d76-84ba-eaf82b5e4aa3","resolution":{"observed_at":"2026-08-08T13:44:00.547913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.556150Z","title":"Speculative decoding with big little decoder","venue":null,"work_id":"43363411-4688-4fb4-896d-7abad303b69b","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.551373Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:81ed85d8a67654162079d59fb4d5d558d25cfd1906ddcb069fd0eb9b6cb8241b","observation_id":"bbe9f86d-16ac-4127-8751-b4fb6bcc56f5","resolution":{"observed_at":"2026-08-08T13:44:01.559923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-08T13:44:00.554454Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.554454Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:198737f894f4472b19bbbb75b82a5ea64599c0b86f4cbab89aeab9afd5935bc5","observation_id":"99319401-96ec-478c-95e5-3543a552728b","resolution":{"observed_at":"2026-08-08T13:44:00.554454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.547127Z","title":"o pf, Yannic Kilcher, Dimitri von R \\","venue":null,"work_id":"2195ed43-beb9-440b-bdd2-ecebe5fe3d02","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.557832Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6182e7068532d9f0f0a58a76decde7f7487bbef058ab20dc77716eadef7409b3","observation_id":"5605fd54-6203-4d08-841f-2d13198d77bf","resolution":{"observed_at":"2026-08-08T13:44:01.550621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08659","last_updated":"2023-11-28T16:06:59Z","snapshot_observed_at":"2026-07-06T16:32:11.601334Z","submitted_at":"2023-10-12T18:34:08Z","title":"LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08659","snapshot_observed_at":"2026-08-08T13:44:00.560727Z","title":"Loftq: Lora-fine-tuning-aware quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.560727Z"},"links":{"cited_paper":"/paper/2310.08659","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e54d9be900940f766f0c5964bb73e7bb9308663c81c56e206dc257d5c14bd8e7","observation_id":"448f8bc4-5c02-4654-a90c-a552d35cd2f8","resolution":{"observed_at":"2026-08-08T13:44:00.560727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.538219Z","title":"Losparse: Structured compression of large language models based on low-rank and sparse approximation","venue":null,"work_id":"d7666125-da5a-40b4-a509-30e09ea85bbf","year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.564027Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:0c025a8583275e5db48d8a565a2200c8312826ced8c6052452507bd912e6d724","observation_id":"1ce2381e-10f6-46c4-8bc8-c2e94232da5f","resolution":{"observed_at":"2026-08-08T13:44:01.541682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07972","last_updated":"2020-05-15T21:47:31Z","snapshot_observed_at":"2026-07-31T00:46:34.847482Z","submitted_at":"2020-02-19T03:05:28Z","title":"The Microsoft Toolkit of Multi-Task Deep Neural Networks for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":"2002.07972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.07972","snapshot_observed_at":"2026-08-08T13:44:00.951844Z","title":"The Microsoft Toolkit of Multi-Task Deep Neural Networks for Natural Language Understanding","venue":"cs.CL","work_id":"0f81d7e5-b48f-446f-973a-6c7860cb2db1","year":2020},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.567152Z"},"links":{"cited_paper":"/paper/2002.07972","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c191236f042e4734cfcda918eee2d60f11f9ce9a317bc063f83489b7b0ae33ab","observation_id":"08840d56-194c-45a0-9a03-329bef4349d9","resolution":{"observed_at":"2026-08-08T13:44:00.955687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-08-07T18:58:35.737110Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-08-08T13:44:00.570594Z","title":"Llm-qat: Data-free quantization aware training for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.570594Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:142a8e942d02bc56c34572f0a945b6920ad7b51a68c4274a11f96c6c384a8734","observation_id":"9bbb9f5b-f553-4d78-9461-5702cce38c02","resolution":{"observed_at":"2026-08-08T13:44:00.570594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-07T05:13:11.135540Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-08T13:44:00.574242Z","title":"Mobilellm: Optimizing sub-billion parameter language models for on-device use cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.574242Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c797fd4efb5e6009974192f981fc4e275611da958006e97245eb92b4892338a3","observation_id":"a1aac243-d292-44e6-8a38-1538e7bab617","resolution":{"observed_at":"2026-08-08T13:44:00.574242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.528698Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":"761df17b-9411-49f0-97b5-ecfece5e8111","year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.577593Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:58de1eb940ba24ecd8374f049b4bbc95fd3f243e07b4fc4ef0728f1051c9cd5d","observation_id":"c7c1be55-0710-45b8-8297-1609f64d69ef","resolution":{"observed_at":"2026-08-08T13:44:01.532044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.580675Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.580675Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:0266c6431f0bd8850166bee322cfc1b47bd83944019f3d3e1d86054f7b36e1b3","observation_id":"d63f4650-1139-4eed-848c-01ff37af7fe7","resolution":{"observed_at":"2026-08-08T13:44:00.580675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.514301Z","title":"Fineweb-edu, May 2024","venue":null,"work_id":"8ddac780-1595-41fd-9de8-efd1df029618","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.583970Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:48f6c376bd376ba22d6f88c3c9adee6488082cd8eeffcc55bdd64c018338590e","observation_id":"f1f98760-770e-4885-b5f7-eb28ddd2e9b4","resolution":{"observed_at":"2026-08-08T13:44:01.518017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.587134Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.587134Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:eb67924cbb55aadff4d501d58fc654532e881fd896a0966e982eb3c786d6ee1a","observation_id":"029c6bc1-782e-44a0-aa33-f43bad5966ed","resolution":{"observed_at":"2026-08-08T13:44:00.587134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.590146Z","title":"Peft: State-of-the-art parameter-efficient fine-tuning methods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.590146Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:914a7363176116fb6807489f5d5fa793d2059c9a9a6beab3894b597b8a2375ab","observation_id":"4357665d-8a38-4c5f-ac05-eba6b630ff83","resolution":{"observed_at":"2026-08-08T13:44:00.590146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-05T22:58:03.938093Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-08T13:44:00.593433Z","title":"Relu strikes back: Exploiting activation sparsity in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.593433Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:650d9802223ec1390fd0b8ba200728e4b412099d46354e31eaea295e2c01fff7","observation_id":"b1b78aea-63f9-44a5-ac99-833b591b03f4","resolution":{"observed_at":"2026-08-08T13:44:00.593433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-08T13:44:00.598069Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.598069Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b64933e0d4af4f93b1798c733d7a782342f621e4b53081c91220b8ed60b5e78e","observation_id":"8c46f36c-57ce-453b-8ee9-57271195c5ea","resolution":{"observed_at":"2026-08-08T13:44:00.598069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.494638Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":"356bc09a-cc9c-488c-b441-1f61ee1327de","year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.601574Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:232c25100432f18bd2fbbc5c51dbc1d524043d0120d96861f737bc036242e6c7","observation_id":"2c0e37d9-602e-4b4e-b89a-2eae112783c5","resolution":{"observed_at":"2026-08-08T13:44:01.498518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.604742Z","title":"The lambada dataset, Aug 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.604742Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b6da51db88e92043521056f782baea772476dc0fa76d9c1705325634e3672247","observation_id":"cd3188e7-a885-4cf6-adbb-99ab332cd029","resolution":{"observed_at":"2026-08-08T13:44:00.604742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.478781Z","title":"Hovy, Pamela Forner, \\'A lvaro Rodrigo, Richard F","venue":null,"work_id":"89046871-b885-4f43-b693-b913809f4547","year":2011},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.608043Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6a6c3f7700dad445eefb51ba0312f50f878a2f688fd025fdb2c2e34beaad8aa8","observation_id":"73e2852b-3fd7-438a-bbd9-86f2ff6cf807","resolution":{"observed_at":"2026-08-08T13:44:01.482413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-08T13:44:00.610889Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.610889Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:706b8cfd1ca50f97f8af19eeb306e0af32f817bd99d74cc29ca69aa80a30188a","observation_id":"94a895b8-0d03-49ae-a33b-828a0dc37633","resolution":{"observed_at":"2026-08-08T13:44:00.610889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-08T13:44:00.614144Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.614144Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:58ba708a14bc305d29f3e1f29e799db9962c08fa250565ad8eccf8855f22cc0f","observation_id":"9ae97c1d-32cb-4a28-bd85-2fe2b0b93c53","resolution":{"observed_at":"2026-08-08T13:44:00.614144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.617414Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.617414Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:dbba4290b15fca80473e64186b9e3b6280d6c77afbc26e764a2175e4d085e8fa","observation_id":"9f48c874-de2e-4c5d-af16-d8b5f722c1f3","resolution":{"observed_at":"2026-08-08T13:44:00.617414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-08T13:44:00.620603Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.620603Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:cf13d89884b9d540dc83f67574a22bf9903f67b4fbc3748cffeca3e0e542b5f0","observation_id":"05bb520b-de63-45e1-ac97-2cefe282825b","resolution":{"observed_at":"2026-08-08T13:44:00.620603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-08T13:44:00.623850Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.623850Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7d8fa359f18d1cdd7f1764b221efef4c5e53c7b06ab073df4cef35ed2faf6ea2","observation_id":"7d118554-e8be-428f-b59f-ac40539283d7","resolution":{"observed_at":"2026-08-08T13:44:00.623850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03285","last_updated":"2024-06-05T06:06:43Z","snapshot_observed_at":"2026-07-06T16:43:42.741094Z","submitted_at":"2023-11-06T17:26:17Z","title":"S-LoRA: Serving Thousands of Concurrent LoRA Adapters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03285","snapshot_observed_at":"2026-08-08T13:44:00.627303Z","title":"S-lora: Serving thousands of concurrent lora adapters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.627303Z"},"links":{"cited_paper":"/paper/2311.03285","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:02a9f68b41219445706ea2140836a44b65153b3ccd1cd4390c8bc5b46e951f20","observation_id":"2bc13ed9-f377-440b-89eb-7d0e1d2795b8","resolution":{"observed_at":"2026-08-08T13:44:00.627303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-08T13:44:00.630570Z","title":"Turbo sparse: Achieving llm sota performance with minimal activated parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.630570Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:aa8f62596c7ec6ca8d095715a9740406966d7b60b28da070ea0c979f404746c3","observation_id":"4429da89-7e1a-4f88-8de7-731eb9f950dc","resolution":{"observed_at":"2026-08-08T13:44:00.630570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.463197Z","title":"Brown, Adam Santoro, Aditya Gupta, Adrià Garriga-Alonso, Agnieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":"745cbe92-db82-4a2c-ac2f-e0ba745b83f1","year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.634440Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6c197441154933d31a8209f4a83404c86565c5dffe0df78ca457893915ed6253","observation_id":"79f7021f-7e3c-4f95-ad0f-c03563279973","resolution":{"observed_at":"2026-08-08T13:44:01.467507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-08T13:44:00.638205Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.638205Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:99c17a601860ed9fb45a3bba5d84ca8e6345169c0a07a43f0fcd0daf291dbc6a","observation_id":"d0863e9f-5c08-4595-a736-0465ac3e2d42","resolution":{"observed_at":"2026-08-08T13:44:00.638205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-08T13:44:00.641561Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.641561Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:023b0ed47fc0692acfc2d3cfe99b6f64c453daad94d2846bbc133ea8ecc3b623","observation_id":"83636a88-52f1-4891-b66d-98e554e2fb56","resolution":{"observed_at":"2026-08-08T13:44:00.641561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06243","last_updated":"2021-09-13T18:19:30Z","snapshot_observed_at":"2026-08-08T21:01:10.366739Z","submitted_at":"2021-09-13T18:19:30Z","title":"KroneckerBERT: Learning Kronecker Decomposition for Pre-trained Language Models via Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06243","snapshot_observed_at":"2026-08-08T13:44:00.645377Z","title":"Kroneckerbert: Learning kronecker decomposition for pre-trained language models via knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.645377Z"},"links":{"cited_paper":"/paper/2109.06243","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:fb19067c533391f088e7552e42765b55d7c915ab718dca0ffc64c6d1d6bb6dbc","observation_id":"aa25504b-1c32-4c06-8ab1-ac8be1fea274","resolution":{"observed_at":"2026-08-08T13:44:00.645377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.648906Z","title":"C ommonsense QA : A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.648906Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:2b29063e1ebb7a7caedff0899d8bee48a13979c4fdd247bce135703389a1cdd3","observation_id":"ba86a792-cd7d-4434-8f78-c84ca18c9055","resolution":{"observed_at":"2026-08-08T13:44:00.648906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02282","last_updated":"2018-05-06T22:14:47Z","snapshot_observed_at":"2026-07-06T06:37:37.681903Z","submitted_at":"2018-05-06T22:14:47Z","title":"Multi-Domain Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"1805.02282","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.02282","snapshot_observed_at":"2026-08-08T13:44:00.832042Z","title":"Multi-Domain Neural Machine Translation","venue":"cs.CL","work_id":"743fadbf-5c79-4216-8e28-b1d3e8ed710b","year":2018},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.652312Z"},"links":{"cited_paper":"/paper/1805.02282","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:27a256626c8ca0da6fb6ec2641f31d68fc722682db3f7c114081f0d51703a3cf","observation_id":"4414b662-01c4-436b-a618-9f0b6af1aae3","resolution":{"observed_at":"2026-08-08T13:44:00.837719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T13:44:00.655703Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.655703Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3ab904f5548f03420f3b7a14060f959e08d70732c2f9d518d2424aea8ebaa2d7","observation_id":"6025f9a1-8fe8-4a9d-88e3-8abc8d210e5f","resolution":{"observed_at":"2026-08-08T13:44:00.655703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02019","last_updated":"2023-10-24T17:58:42Z","snapshot_observed_at":"2026-07-06T16:02:19.253303Z","submitted_at":"2023-08-03T20:20:01Z","title":"Baby Llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02019","snapshot_observed_at":"2026-08-08T13:44:00.659142Z","title":"Baby llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.659142Z"},"links":{"cited_paper":"/paper/2308.02019","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7de35e6b03ce4d04934ce25e68627b41adfd5bc819ecc9cbd10e4f0b6827191e","observation_id":"878a148a-0bcb-4fc8-86d7-4e755cb41522","resolution":{"observed_at":"2026-08-08T13:44:00.659142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T13:44:00.662881Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.662881Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b34868c722af3226e2eef178072eecb63928aa602f206daa9d5fe0b0a761931c","observation_id":"f3aa82dc-5707-4ac0-a5d0-6748380455f8","resolution":{"observed_at":"2026-08-08T13:44:00.662881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.666585Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.666585Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:a8eba315477b32e3da7659cc5b52fc3960b8d475874780f02002069be84dd9db","observation_id":"a189eff1-a16f-4fbc-9d37-3025366e41d4","resolution":{"observed_at":"2026-08-08T13:44:00.666585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.449067Z","title":"Liu, and Matt Gardner","venue":null,"work_id":"90edf375-c736-4693-9c21-167a7b539be2","year":2017},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.669764Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:529324efaa5d3aa87e82c39cb5283455aa9a434b5c4ef943af5541aa7e0553ee","observation_id":"6090a7a2-414f-4013-9fd5-43057ea2c880","resolution":{"observed_at":"2026-08-08T13:44:01.452340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10285","last_updated":"2023-09-19T03:20:02Z","snapshot_observed_at":"2026-08-01T16:15:23.171765Z","submitted_at":"2023-09-19T03:20:02Z","title":"Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured Sparsity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10285","snapshot_observed_at":"2026-08-08T13:44:00.672927Z","title":"Flash-llm: Enabling cost-effective and highly-efficient large generative model inference with unstructured sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.672927Z"},"links":{"cited_paper":"/paper/2309.10285","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:4f958aff8541a053783274bc28f690634bd8f1c530ff478566c1526596ecbcf2","observation_id":"72d3a5b1-ca63-4a16-bac2-3fb80da30ac2","resolution":{"observed_at":"2026-08-08T13:44:00.672927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-08T13:44:00.676353Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.676353Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:81e6b25f7f07c4e0792e8e21f2a5c203b2402d54d07c2775391ae7c20bb02fa9","observation_id":"197c667f-0f91-4cb0-9932-05469fef679c","resolution":{"observed_at":"2026-08-08T13:44:00.676353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.680017Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.680017Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c0067a5335774c0d0df5f143bc3dee5273f2e064e1dc7f6592f317a253871981","observation_id":"398d67a9-e006-4337-9adf-55117488af82","resolution":{"observed_at":"2026-08-08T13:44:00.680017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.683256Z","title":"Wizard LM : Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.683256Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:fd7ccc2ceceabfc3dfc46db0b8ac880541599bc9e8bfe7298900378a91e6440d","observation_id":"006da0f2-6bb7-4c61-bd0d-254ff8a5779e","resolution":{"observed_at":"2026-08-08T13:44:00.683256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.428976Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"422e8e63-05e8-429b-ba84-db391e0e9c44","year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.686408Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:960f9aa6bcc84d96355139452daf8bcc7d2861713f747c2ad565625138437211","observation_id":"a40591c7-eb13-4dae-9979-8ad86ed6550b","resolution":{"observed_at":"2026-08-08T13:44:01.432369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-08T13:44:00.689555Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.689555Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:d12d928fe8a0e7351248c713e55c18ab04322684b99cb4864886af35c95a18ae","observation_id":"d552fbc1-bcdd-4087-80e6-6d7e01384118","resolution":{"observed_at":"2026-08-08T13:44:00.689555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-08T13:44:00.692882Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.692882Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:621a13068fc3550516f41cd17c920a9de54aff4bf5badb14e29d1318a4ab8dbb","observation_id":"e2ada6c8-054c-4cf5-b556-dffa5ae0fd7f","resolution":{"observed_at":"2026-08-08T13:44:00.692882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-08T13:44:00.696184Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.696184Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3fc533bfaf35dab240af28a984dda7e43d86950948e2e2d4f384c5c913722b45","observation_id":"6a0cda3f-0f67-4f00-b8db-30140497589f","resolution":{"observed_at":"2026-08-08T13:44:00.696184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.419597Z","title":"Adaptive-precision framework for sgd using deep q-learning","venue":null,"work_id":"e0c7f1ff-48f7-47ae-a9ad-8cdf7cfcbd45","year":2018},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.699834Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c3b45347a48452b013fd213a19b6899ed4abe37b873d309e4a9fc0478f9e924e","observation_id":"788b02db-186b-4043-aaa4-f3b04a13b843","resolution":{"observed_at":"2026-08-08T13:44:01.423105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.410268Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"64a9ae9c-5168-4d53-837f-f7b335466291","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.702933Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:29ea6c8c59ada66501c6a492f589ac16634c36744fdde14fe6b476b61d1478cd","observation_id":"f457a825-98a0-48cd-883c-08043957a28e","resolution":{"observed_at":"2026-08-08T13:44:01.413628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.705824Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.705824Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e7893a8b21a63b22a957df071dd4ed00752c2af1ba9be635e518342dcf633106","observation_id":"77948001-69c7-4cd3-8931-ccdf9ca04e35","resolution":{"observed_at":"2026-08-08T13:44:00.705824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.708804Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.708804Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9363c575e9e0c969be088c276d28e2a6aa1a475bd53fea3d67c16c0689ec88c0","observation_id":"1e7fd59a-1c84-4197-b6b6-2ef9c4a72fd9","resolution":{"observed_at":"2026-08-08T13:44:00.708804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.712425Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.712425Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:13e588c8421898e69509900eb823d63d66cc40eba48ac9703eabb7ac4e5df721","observation_id":"f32fecc0-8bc8-4ca4-ab83-82106412c486","resolution":{"observed_at":"2026-08-08T13:44:00.712425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.717308Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.717308Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:43df91f5153104254117a37080b6ebdbae672e851d10b4088ef0bdc5ca5f7cde","observation_id":"669dfaa8-092f-47d8-970c-c4cf8d21571f","resolution":{"observed_at":"2026-08-08T13:44:00.717308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.720633Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.720633Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:bd137eff394de66a5fc3e289de34c8877623008379dc65437b62e80dbca54f90","observation_id":"555edb9b-f77f-4b11-a6a6-97964e650b49","resolution":{"observed_at":"2026-08-08T13:44:00.720633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2502.07832."}