{"as_of":"2026-08-23T13:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edb56d9d0f6dc9e0130f1a49732ca7955e22f924ebeabdaa34dda17aae42afee","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:06:41.062180Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03510/citation-record","integrity":"/paper/2506.03510/integrity","json":"/paper/2506.03510/citation-record.json","paper":"/paper/2506.03510"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.072019Z","title":"Slicegpt: Compress large language models by deleting rows and columns","venue":null,"work_id":"cf16c1e8-784e-4c97-afd9-6af3738ece01","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.206536Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:edff22c0b0276a2ef8eb8660682225ec4a2f9c37f3f57c5926e6cd9d84bb811e","observation_id":"5556fa6b-2f0c-49df-abfd-fe95bc6ab418","resolution":{"observed_at":"2026-08-07T11:06:47.075297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.564223Z","title":"• ARC-Challenge and ARC-Easy[Clark et al., 2018] are datasets composed of grade-school level multiple-choice science questions","venue":null,"work_id":"065f2860-01e9-44ab-aec8-5fa3cb60d6f7","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.829414Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:b3b63a93560e4cc094291bb70bb1b5fc2d56c12971b806c29a054ca09be82f20","observation_id":"aa1fee7e-3982-41fb-ad3d-30f40759b92d","resolution":{"observed_at":"2026-08-07T11:06:41.653879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.821314Z","title":"Pea-kd: Parameter-efficient and accurate knowledge distillation on bert","venue":null,"work_id":"3433d6a3-60dc-45ba-b6f5-7885c4e7c8b8","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.414283Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:f03c487c20ce227b35aa997086cf7b5b202ff228df73e20aa715d1590fd162ec","observation_id":"e01af565-2563-4ba0-ac88-66611601c497","resolution":{"observed_at":"2026-08-07T11:06:46.934334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.254468Z","title":"This demonstrates that five candidates are sufficient to find the sublayer with the least importance score","venue":null,"work_id":"f45f008f-d1d5-4987-85ff-98a6fcab9e07","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.983994Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:2707e77d58e0fdbe50ef32e6bace60310cd2dde31460e7a2e7a8e47e5c484b66","observation_id":"38237da4-63d0-476f-9c26-bc362fbc1804","resolution":{"observed_at":"2026-08-07T11:06:41.342946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.736502Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":"77d30bad-9d56-4c65-9ddd-e47d0f6fe26c","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.893937Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:8b2939cc89e95fa3840a87e571489d64298c845125ec780714a9729a5be6ec40","observation_id":"662f402c-6d1d-4514-8715-854e9007b60e","resolution":{"observed_at":"2026-08-07T11:06:45.856973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.529196Z","title":"OPTQ: Accurate quantization for generative pre-trained transformers","venue":null,"work_id":"7d9d7081-7cca-4a9f-b539-0d1502d306cf","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.954853Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:5a3ea5f6f44dc9c0c986b505ad1a906eddcb3633038dd18fe85b61ddac6ea3b3","observation_id":"7a9db158-1b3b-4329-bf3c-fedc0359d932","resolution":{"observed_at":"2026-08-07T11:06:45.688354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.355291Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference","venue":null,"work_id":"9a66ab98-d9d0-4974-85f7-3471f185f8d5","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.036607Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:0e0cb74ec662d135a4f7652ce8e7597d5f58f65d17e07b809e470ddb4e4686af","observation_id":"0dd00334-b931-47a4-a8d4-f03df3027c78","resolution":{"observed_at":"2026-08-07T11:06:45.418760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.171838Z","title":"A frame- work for few-shot language model evaluation, 12","venue":null,"work_id":"1cc64d75-7eb0-49e0-924e-a94a599634bb","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.140621Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:490bdefc67c2a6715bb5b32e85f66126d8c8288982181e70396468f7e8c8d137","observation_id":"9c5207f5-51a4-4bd3-85b5-6cedc6725560","resolution":{"observed_at":"2026-08-07T11:06:45.239781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.008141Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"5bcf427b-b441-4fa0-8b10-6f789647256f","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.218182Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:990eefc8ce24224b9750c4b33883f0cfdeb95f980701eaad7f39524b509c6eac","observation_id":"22e84dfc-d61e-4113-b2c8-148e3b09b1f1","resolution":{"observed_at":"2026-08-07T11:06:45.068132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.920455Z","title":"Falcon: lightweight and accurate convo- lution based on depthwise separable convolution","venue":null,"work_id":"63129d77-2360-4de4-8d34-239f0b8f4efa","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.333525Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:8311663991393ff042736959f898a5fdfde9fe96b8d1bb902c8aa5333c5604f5","observation_id":"b75d018c-4b48-4a64-b762-152809afba74","resolution":{"observed_at":"2026-08-07T11:06:44.989062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.842328Z","title":null,"venue":null,"work_id":"e7efab6a-458f-448c-a87b-a2e261efa380","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.442187Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:ef10f7817f2d1b34d270a4af973e64fd02f2e2ff4c62a99d753f77717e0cf9f8","observation_id":"90598526-0a8a-4c41-b45d-74f3b64d6507","resolution":{"observed_at":"2026-08-07T11:06:44.876957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.737612Z","title":null,"venue":null,"work_id":"0164fd1d-f1bd-4d84-b1db-b7fddd59a9aa","year":2021},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.550725Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:96233627ad571b0a5a424e75f70e2262a984e9feba8c2f2f6722dfc4047d96b0","observation_id":"61086d0b-0683-4ab0-8507-943d620cd40c","resolution":{"observed_at":"2026-08-07T11:06:44.783332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.524732Z","title":null,"venue":null,"work_id":"942e3d12-7bbd-46ea-9715-1749a4f3d0aa","year":2021},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.743850Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:f5a75a809844f82a9913281e87df67f1c2ac944dc18b3ebcadef65fd97741806","observation_id":"dfd76e9a-163d-41eb-9838-4cd5703574b0","resolution":{"observed_at":"2026-08-07T11:06:44.580464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.290710Z","title":"DDK: distilling domain knowledge for efficient large language models","venue":null,"work_id":"71bbc4d7-7eef-43db-9a6f-5d1600b4183e","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.951134Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:8938e9fcdbc4b73adf6fd69cc69f47d291361b410b9f04d6980d7b8b474d0f59","observation_id":"5235280a-ba91-4152-8169-b2c466d0e57f","resolution":{"observed_at":"2026-08-07T11:06:44.347291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.170297Z","title":"Llm-pruner: On the structural pruning of large lan- guage models","venue":null,"work_id":"0c7bb5fd-a9c4-4454-9da2-1535da2a19f7","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.074936Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:22575ea197e2538981c18b5b87b6f06e8666bdd7a0ad9d88999b7986346dd5b6","observation_id":"5634f1d0-04b7-40a3-bf6b-b7e174af23a0","resolution":{"observed_at":"2026-08-07T11:06:44.243254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.071671Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":null,"work_id":"0b9603fc-204e-4a9c-8c25-7c427fe09165","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.230392Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:b5e097ec04066abb2c0f8e9b5eec5f57564a88f7c2078edb4885d9faaf02bcbe","observation_id":"bbaf37f5-70f7-46e7-9ad7-22660095dc21","resolution":{"observed_at":"2026-08-07T11:06:44.109191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.945352Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"883db985-2103-4551-956c-cd16e5e1c318","year":2016},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.380345Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:da36a0ef565e767955c5bcc7e06eedc949ed9f95b4f3a6e1e86219ca6790aca7","observation_id":"12d06413-1a80-4661-852a-7e0e5163877e","resolution":{"observed_at":"2026-08-07T11:06:43.997597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.814336Z","title":"Sensimix: Sensitivity-aware 8-bit index & 1-bit value mixed precision quantization for bert compression","venue":null,"work_id":"72efa2d3-4db1-4b6c-94b1-f9cd80873f9e","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.571943Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:7646a3078495c5db5350628a81de90212a4484b9f8381c80c65f972fc5a785e0","observation_id":"0f0aae67-aac6-4589-b922-b40e8174a583","resolution":{"observed_at":"2026-08-07T11:06:43.866307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.718896Z","title":"Mixture-of-depths: Dynamically al- locating compute in transformer-based language models","venue":null,"work_id":"c281d5c8-9a69-405e-a62a-4fc635c0efcd","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.666897Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:51014dd5722bfb57137dfe9a82a21e95475b4e8367a8353dab8d440b3ba45578","observation_id":"69e25463-b4f2-48c4-a910-89cb9613309a","resolution":{"observed_at":"2026-08-07T11:06:43.775359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.614219Z","title":"Exaone 3.0 7.8 b instruction tuned language model","venue":null,"work_id":"024ae480-1952-49ce-9612-2a82846fce81","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.844672Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:46ccb5cada6d0219fc2a327699cb83b6c68e97cdbc96c807e7206ca7761a8e51","observation_id":"2e88c0cc-9fc4-499e-8b3a-59aee2d02567","resolution":{"observed_at":"2026-08-07T11:06:43.642116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.476747Z","title":"Confident adaptive language modeling","venue":null,"work_id":"a26e3129-a815-4243-9085-ab6cd6abe183","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.001779Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:685cfcbba7980629351cf356eb9cf003aa8a50eb508fc2149bd6472a62797c95","observation_id":"8fa26fd2-3181-48d5-b2bb-ec9cf99d3a37","resolution":{"observed_at":"2026-08-07T11:06:43.540375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.324237Z","title":"Omniquant: Omnidi- rectionally calibrated quantization for large language mod- els","venue":null,"work_id":"b18720fd-5eaf-46f5-b9fe-8bf3a5e93e85","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.117420Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:7843c7f27826a5ec5297e32ec671449f66e170037996ead9411ec1abd7996756","observation_id":"010dc779-83e3-4e6f-acb5-d19675455bbf","resolution":{"observed_at":"2026-08-07T11:06:43.373199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.131153Z","title":"Sleb: Streamlining llms through redundancy verification and elimination of transformer blocks","venue":null,"work_id":"b6d73c6e-3283-4066-a270-bf1d55f62e41","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.178601Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:bb502695347b321fc7ba6bd1eae280150df868bc19f96d44182b3aa67b05f58b","observation_id":"4b1d685d-2559-4158-89a4-b03b97987496","resolution":{"observed_at":"2026-08-07T11:06:43.227336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.961477Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":"1fba31f7-f524-4c77-81fa-e0968f78975d","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.242222Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:461961d20c193c79fb074377d5825c28d10a0ac44a8ca8b0b7b0e4113fa9dec7","observation_id":"2140cf69-46e2-4cc5-b1dc-37371f098a7d","resolution":{"observed_at":"2026-08-07T11:06:43.038919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.808724Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":"07048956-94c8-4ff7-9f78-d7a6763b6c65","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.313820Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:dcee9f5f23c932e3eed33cb51fdc517c1dd410584776052f493a0e7e33154142","observation_id":"97329a70-27f7-43d8-870c-50f274ae52ed","resolution":{"observed_at":"2026-08-07T11:06:42.890677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.679662Z","title":"Accelerating llama infer- ence by enabling intermediate layer decoding via instruc- tion tuning with lite","venue":null,"work_id":"dd9d1fd0-3f88-49b5-aa9e-a3388b088795","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.358457Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:54312fd660c65baa53d6dfb538428b58536aa68e29bf7459a5a90b1bbb8b9990","observation_id":"472f7a99-b653-4b6b-bb98-fe8f39d00ee4","resolution":{"observed_at":"2026-08-07T11:06:42.736879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.565578Z","title":"Attention is all you need","venue":null,"work_id":"22c313f4-97c4-49f2-a7c6-44e95082eab3","year":2017},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.415973Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:22cabfd06019278616967b17298c3c9f02157a65b0dab3d53cbefc8d531e9041","observation_id":"b6ec1720-b2c9-45df-8ca1-06f156af4020","resolution":{"observed_at":"2026-08-07T11:06:42.606699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.309072Z","title":"Outlier weighed layerwise sparsity (OWL): A missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":"d4a185f6-ed51-4e61-98b1-66cefbe46c04","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.533464Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:fc7498222a5f0cb324d29aa20bca7afba44d7344525d840acb8edda3994d3be0","observation_id":"09eba7dd-b119-43f7-a49d-34a9e96886ab","resolution":{"observed_at":"2026-08-07T11:06:42.367414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.181361Z","title":"Knowledge extraction with no observable data","venue":null,"work_id":"c3240856-ff1f-4030-91d5-4674a82a968a","year":2019},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.597396Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:80ccbed09238674020f7d7bedd116ede4b38ccf12ce22d5e064dfd250a61f3a4","observation_id":"10c44411-5b20-437a-9bd8-69aab4373dad","resolution":{"observed_at":"2026-08-07T11:06:42.232594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.039903Z","title":"Hellaswag: Can a ma- chine really finish your sentence? arXiv,","venue":null,"work_id":"62aedd0b-312b-4b06-8bad-5f085771a788","year":2019},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.672976Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:cdefb8c1e30a6f27ee2679d89c28f67e909f3d0a1021b3ccf838453fccd627de","observation_id":"b9686ceb-7242-4416-a864-7bc9aead71ef","resolution":{"observed_at":"2026-08-07T11:06:42.083604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.893713Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":"8a1502c5-cf40-4363-b5a1-1a73c91a4067","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.737335Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:a2edeed3007f92cc20af1e1b01a6c895093bd965d188f765ebc23f1efc8cc2da","observation_id":"e09bf8af-4cc2-4796-a241-0ad8ba18e944","resolution":{"observed_at":"2026-08-07T11:06:41.951101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.722086Z","title":"Blockpruner: Fine- grained pruning for large language models","venue":null,"work_id":"682742f9-9bb2-4a27-a953-94c355e6fe2c","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.777241Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:42e6302d6a57eae70bfbd501ead42eb530c92f7b1f77d13c2a4687a862ff9253","observation_id":"e680e9dd-125f-4e8c-99b4-24799b1a1e9d","resolution":{"observed_at":"2026-08-07T11:06:41.819965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.148686Z","title":"LLM-Pruner cannot prune Llama-2 70B and Llama-3 8B, 70B since it does not support group query attention","venue":null,"work_id":"4c1f7af7-9ef6-471b-915f-836a89d3998f","year":null},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:41.062180Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:c3d0f862465dfa3e30f6a9fa81efa6e90133e97051da9d3618ae90d62b24147e","observation_id":"a6c6d7c0-a273-46d9-9568-efd467e9c860","resolution":{"observed_at":"2026-08-07T11:06:41.205996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.400815Z","title":"We use a single GPU to evaluate Llama-2 7B, 13B and Llama-3 8B","venue":null,"work_id":"3997c8e5-a473-4d6e-8cf8-135a9af4f488","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.892994Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:be012b09f2b0a52b31d3a4ac09aaabeee36da3d12e2d472e96754ddf5c64ead9","observation_id":"34f0ca9a-7111-4823-8ce8-3ce34f438b41","resolution":{"observed_at":"2026-08-07T11:06:41.502576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.422431Z","title":"Qa-lora: Quantization-aware low-rank adaptation of large language models","venue":null,"work_id":"c4bf8e42-eb83-4c95-a1ca-b05869fccaf7","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.478109Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:c180e723ea2674ea809ffb7f9977a0b4cb94dc2aafbddcca47c20cc22896b6a1","observation_id":"a8a4870c-8c8c-4888-b5eb-97a159a6e20b","resolution":{"observed_at":"2026-08-07T11:06:42.486150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.183649Z","title":"Boolq: Exploring the surprising diffi- culty of natural yes/no questions","venue":null,"work_id":"86987a17-7dfa-4d49-8405-6585f4006973","year":2019},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.701919Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:2e004d25ad4822cba7dddac9df7d9dff6fcf1571826935baa4d5175e1eedf242","observation_id":"6208b8cd-86ff-4936-a3f7-bf9d8d13b290","resolution":{"observed_at":"2026-08-07T11:06:46.351963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.993295Z","title":"The llama 3 herd of models","venue":null,"work_id":"c8e5a7e2-3ac5-4c85-ab7b-d99d266d8793","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.810918Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:377817649eb40986894f33e49c93906aa430c1a3fa5cd1bcd21c57d84389a4b9","observation_id":"c3660369-e8ee-4ff8-ba96-58a416a8c0a0","resolution":{"observed_at":"2026-08-07T11:06:46.034194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.036135Z","title":"Language models are few-shot learners","venue":null,"work_id":"46d2aaeb-90dd-49e4-9f3c-6e96a8700eba","year":2020},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.324634Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:8a159ee0e3d4fc33eae526bcb30c5da26d998a40909c40e4258bb12ce5b2b36e","observation_id":"262e6f9e-725a-4f8c-b8cd-7eca616d768b","resolution":{"observed_at":"2026-08-07T11:06:47.056001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.415176Z","title":"Flexround: Learnable rounding based on element-wise division for post-training quantiza- tion","venue":null,"work_id":"3ebd684e-5841-41aa-8afc-43fddae9deaa","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.853165Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:f61e542f063b6210082d1f9dd55e959aa0669f8b784b3ce6d7a267ea6580d940","observation_id":"76a1307c-49d8-4f7d-bccd-a6c255ac0ab9","resolution":{"observed_at":"2026-08-07T11:06:44.456308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.598034Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"c8cc1b9a-1e71-4e0a-ab74-12c005751dcb","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.510415Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:03605454e44131f58be24d3d8f70c17268f1e983845e2f6158325c43db4f4d32","observation_id":"75c45ef0-2e10-403a-b356-6c4eade2493a","resolution":{"observed_at":"2026-08-07T11:06:46.717315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.419207Z","title":"Think you have solved question answer- ing? try arc, the ai2 reasoning challenge","venue":null,"work_id":"ec7ca069-365f-4cee-9568-b1fec94d3a97","year":2018},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.633240Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:b2cf0c9f9c635e204cfe83b78cfbaebf4034f41e824518c1b1ee8e1d7dde9c9b","observation_id":"ee1a10d3-c294-4b29-834f-e99a59aef860","resolution":{"observed_at":"2026-08-07T11:06:46.487145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.063000Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"3cb11abd-c0e3-47eb-86bf-86d133bdfd01","year":2020},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.233404Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:d4dd24b310487cda8ae7a3e7768aae00411ead381fff85a468208fd50e049df1","observation_id":"08a4932e-0ad1-4204-ae89-03e97ba2dec3","resolution":{"observed_at":"2026-08-07T11:06:47.066226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.622837Z","title":"Distillm: Towards streamlined distil- lation for large language models","venue":null,"work_id":"d2185f3b-b5af-4882-8ba0-d8ba8d22b9df","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.628367Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:51a0ba5dd68dd1cf7a189d8699dac6ef32cc6f98ffa14127b446308991959d35","observation_id":"83424917-ff2e-41e3-bc0e-ba0caa9b00ec","resolution":{"observed_at":"2026-08-07T11:06:44.670504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.03510."}