{"as_of":"2026-08-05T21:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:faafc91143f8ce953c48813732e71c49cac5591abf4e07465a3a7e0f345d761e","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T08:00:58.889699Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28418/citation-record","integrity":"/paper/2607.28418/integrity","json":"/paper/2607.28418/citation-record.json","paper":"/paper/2607.28418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:55.639927Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Check- points","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:55.639927Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:547a67e6ca3e3c69da12a1379f3c34f23ddc751529353aae506c05af30c0ab5b","observation_id":"14a5e14e-eb41-47ba-ba23-52a3b4de683e","resolution":{"observed_at":"2026-07-31T08:00:55.639927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:56.693409Z","title":"Aayush Gautam, Mukul Gagrani, Junyoung Park, Mingu Lee, Chiris Lott, and Narasimha Reddy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:56.693409Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:97b603e6800a85b6c23b1add26a61e9672e679956daf68f98d9fef40ca41e4e4","observation_id":"28e3d8ed-21e3-46ad-a6e6-ef790d2c7e65","resolution":{"observed_at":"2026-07-31T08:00:56.693409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-31T08:00:56.882801Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:56.882801Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:5c1545746f401d60d0ad72c6b7aa1b8436699a17559fae324c30fff8391160e7","observation_id":"381875ad-a1bb-49c5-90f3-3719cf8d460a","resolution":{"observed_at":"2026-07-31T08:00:56.882801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:56.974233Z","title":"Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:56.974233Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:8a987bb25a484449f8afef15a4985c27e65495325a58fcddfc4dbb858d567636","observation_id":"10e4d762-f8a0-43a9-91d1-7b22c387d452","resolution":{"observed_at":"2026-07-31T08:00:56.974233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15786","last_updated":"2024-10-17T02:43:35Z","snapshot_observed_at":"2026-08-03T10:43:35.890260Z","submitted_at":"2024-06-22T08:41:48Z","title":"What Matters in Transformers? Not All Attention is Needed","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15786","snapshot_observed_at":"2026-07-31T08:00:57.075282Z","title":"What Matters in Transformers? Not All Attention is Needed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.075282Z"},"links":{"cited_paper":"/paper/2406.15786","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:ec0c0d78e44adc19d3ec1d0cad3b876de6bead6b41e176f9e09a500ce7477e19","observation_id":"98b69cac-ce80-43e4-a590-29f0286678a3","resolution":{"observed_at":"2026-07-31T08:00:57.075282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14785","last_updated":"2026-07-26T17:22:03Z","snapshot_observed_at":"2026-08-02T18:16:43.947213Z","submitted_at":"2026-03-16T03:35:04Z","title":"SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14785","snapshot_observed_at":"2026-07-31T08:00:57.151768Z","title":"SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.151768Z"},"links":{"cited_paper":"/paper/2603.14785","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:09a7236e50d75dba49e9335e6b3e4788199f61c56e10187d4d64ffea7bf73fec","observation_id":"1549c1fe-7474-49c3-982e-86d91dba9b22","resolution":{"observed_at":"2026-07-31T08:00:57.151768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.08065","last_updated":"2026-05-11T10:21:15Z","snapshot_observed_at":"2026-07-06T22:48:21.803560Z","submitted_at":"2026-03-09T07:59:17Z","title":"Deterministic Differentiable Structured Pruning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.08065","snapshot_observed_at":"2026-07-31T08:00:57.357203Z","title":"Deterministic Differentiable Structured Pruning for Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.357203Z"},"links":{"cited_paper":"/paper/2603.08065","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:a3dc7aad9005f57877b40817a58fe06724b4de35b345f70822e0f42a74b5d957","observation_id":"c213ac60-5bda-4ec8-91fd-8196332a3d9b","resolution":{"observed_at":"2026-07-31T08:00:57.357203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-07-31T08:00:57.433405Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.433405Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:adac221bdbf215f938b8161f444f1603057cdb30c6e6b3563764fe211d014cee","observation_id":"495e1156-fba4-46a6-b714-4b891f85dcdc","resolution":{"observed_at":"2026-07-31T08:00:57.433405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-07-31T08:00:57.514150Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.514150Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:c2679e614f667569d006759593b6e18924645c64ab3bbd25682b54cfc5453df9","observation_id":"d7989027-7692-42dd-8eed-787777d7179d","resolution":{"observed_at":"2026-07-31T08:00:57.514150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:57.669892Z","title":"ISBN 979-8-89176-256-5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.669892Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:b3bb8752b1870258d841ddbea23d6959e54ea65cc48d68882e8e2b5ebb01045a","observation_id":"4d3b58ca-6464-4a25-be78-e48ffc7d3e96","resolution":{"observed_at":"2026-07-31T08:00:57.669892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:57.743179Z","title":"Stephen Merity, Caiming Xiong, James Bradbury, and Richard Socher","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.743179Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:1004830231f9384d1fa7140c1b1d0e783290bff45e6db6da67355217b26111ba","observation_id":"5606eacd-749e-4cea-95ae-268e8308412e","resolution":{"observed_at":"2026-07-31T08:00:57.743179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-07-31T08:00:57.954548Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.954548Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:31f1e3c46f757d56ae8cbf61c4ef6649f49f9a507048a6a427f53ee89d18bb85","observation_id":"8917b35a-ef5c-47fd-b702-a68d36f06791","resolution":{"observed_at":"2026-07-31T08:00:57.954548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-31T08:00:58.029846Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.029846Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:f46bdd322bb565d437a2b26aae54cd8f49996661fc3cc762b94677b17440972e","observation_id":"38989719-78ca-4c0e-b31c-7faf68d8168f","resolution":{"observed_at":"2026-07-31T08:00:58.029846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:58.163890Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.163890Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:47c6d78af82faefb13f807cd249f2a539defd04787168aa3de2bdd2a10a07054","observation_id":"d115edfb-a0ad-44d3-b67d-fd5229029cd3","resolution":{"observed_at":"2026-07-31T08:00:58.163890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:58.302250Z","title":"ISBN 978-1-4503-6719-6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.302250Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:810e3fa12569627ad0fa2b9f9d665a55f702e148d17c809d7c865256f6cf4e93","observation_id":"a565838b-d42b-4e62-9de7-fa3f45a0f6da","resolution":{"observed_at":"2026-07-31T08:00:58.302250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:58.412700Z","title":"From data to model: A survey of the compression lifecycle in mllms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.412700Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:4a6bfe4a7f124cc9626ed84589daef567595e97aae837ffc467bd9f625308757","observation_id":"73e7ee6a-a361-482d-84aa-7685fb4d7dcb","resolution":{"observed_at":"2026-07-31T08:00:58.412700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-07-31T08:00:58.486093Z","title":"Hellaswag: Can a machine really finish your sentence?arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.486093Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:107b64c7c2416babcbf48d456da295b879b511375f29e293ced97daeaa9e88cb","observation_id":"9f8c2fc2-b59f-4750-9b50-d251b67ba0b6","resolution":{"observed_at":"2026-07-31T08:00:58.486093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-07-31T08:00:58.573833Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.573833Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:ef0b0a35d10a359ef60cafc03e644b7a606f08c81fc19ffe48b7a0070d67053e","observation_id":"dc606566-4ed4-4758-9a86-1855bb5c6cdb","resolution":{"observed_at":"2026-07-31T08:00:58.573833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:58.648132Z","title":"BlockPruner: Fine- grained Pruning for Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.648132Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:4b61374bebe1cd976ccae86ad14fef61b290198eda28f86750babb3a9c9961d9","observation_id":"ff557a35-e2cf-4d95-b30c-1011573e922a","resolution":{"observed_at":"2026-07-31T08:00:58.648132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:58.715077Z","title":"mk,mnk->mn","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.715077Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:7ad2b9e898aa4048bab1b2deef14df3cbe0366bb12c75775260d2e9c856e0e7c","observation_id":"fb712a9d-6a89-4271-91eb-9e7755f88ad2","resolution":{"observed_at":"2026-07-31T08:00:58.715077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:58.805392Z","title":",min(P−1, N K,g)−1do 6:PREFETCHK(g, q, qmodP, s (1),J)▷ ℓ= 1: predicated A loading 7:end for Group-local pipelined mainloop 8:fork c = 0,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.805392Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:c1d2efbc5300049eb7c5763e4a115d5e5a6bb239196f1dd35ddedbc8e1e8532c","observation_id":"ebed3562-4213-4a99-9420-a259a3cc4ef5","resolution":{"observed_at":"2026-07-31T08:00:58.805392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:58.889699Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:58.889699Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:097c2f90d32d3fe9b22233a309b66ee354a9b123fd424ba3d809d1aaa75e35ba","observation_id":"0a16f832-abcd-4875-bdca-2421050f47ab","resolution":{"observed_at":"2026-07-31T08:00:58.889699Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-07-31T08:00:57.839457Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering.arXiv preprint arXiv:1809.02789,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.839457Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:c935bb6af77f26a6d037d91a4abf078ef1ae94bb4a6f8200d6985da9bb03ada8","observation_id":"7bca8173-c57f-4dec-a62b-8923254aea64","resolution":{"observed_at":"2026-07-31T08:00:57.839457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:56.474852Z","title":"CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:56.474852Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:e1e59b1b7bbc5ed3b59b4cbdfd2fece36cef6c71c1573054bcedea80e33ef075","observation_id":"7b08da84-25c3-49ef-860a-93f29aa8e4cd","resolution":{"observed_at":"2026-07-31T08:00:56.474852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-31T08:00:56.297010Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:56.297010Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:ae9608035cd2c84e10ab3c15dde143c82c8671ad1c290e01705f2b15e031ff9b","observation_id":"ebc3e5f2-7465-4512-9f8b-73b9875790cd","resolution":{"observed_at":"2026-07-31T08:00:56.297010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:55.772555Z","title":"A VO: Agentic Variation Operators for Autonomous Evolutionary Search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:55.772555Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:48e28ae9c2e04b61ca271d1dcb0f5a25fe1d18583c6ba64d492827aaea5678a9","observation_id":"49fd00fc-d098-4dab-b424-1691a1e0d443","resolution":{"observed_at":"2026-07-31T08:00:55.772555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09080","snapshot_observed_at":"2026-07-31T08:00:57.256732Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.256732Z"},"links":{"cited_paper":"/paper/2606.09080","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:1fb0e0ce5beaa33d3d3fd3e27ec65f1aa57c200672cc4c2e6ad718c33ddfabd8","observation_id":"0eab88f6-d7a0-44b4-af9a-40fc86ba8dc1","resolution":{"observed_at":"2026-07-31T08:00:57.256732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:57.598751Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.598751Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:6c2a2ac1883f431fc2ea4a8552889c6bc508e3146173599a75f9564cee7bcf04","observation_id":"f364ec6e-911e-4e10-99a4-791808beaefc","resolution":{"observed_at":"2026-07-31T08:00:57.598751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T08:00:56.072867Z","title":"ELANA: A Simple Energy and Latency Analyzer for LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:56.072867Z"},"links":{"citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:944ee6e92aa474eeae74ce21d1a3bd0c07a41259ce2db4f0f914b0dd5df1ea89","observation_id":"1cdcb772-d14a-47c6-aacd-83df05c840f4","resolution":{"observed_at":"2026-07-31T08:00:56.072867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-07-31T08:00:56.200139Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions.arXiv preprint arXiv:1905.10044,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:56.200139Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:445b7a04e4d9c6a9afd79fcb20048e65cce392cf9a359e57eaadfe70881658c5","observation_id":"24ccee6c-0cc0-4d8e-94a7-3c3a92efa665","resolution":{"observed_at":"2026-07-31T08:00:56.200139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06767","last_updated":"2024-08-09T03:44:50Z","snapshot_observed_at":"2026-07-06T16:05:42.952649Z","submitted_at":"2023-08-13T13:34:04Z","title":"A Survey on Deep Neural Network Pruning-Taxonomy, Comparison, Analysis, and Recommendations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06767","snapshot_observed_at":"2026-07-31T08:00:55.931442Z","title":"A survey on deep neural network pruning- taxonomy, comparison, analysis, and recommendations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:55.931442Z"},"links":{"cited_paper":"/paper/2308.06767","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:a7bef2b674377e2d7861054ffacce5c03cc992a9bb2447f25ffd3ba521a4935a","observation_id":"30b4fb0c-0755-4a82-bcac-3fcdb7c60651","resolution":{"observed_at":"2026-07-31T08:00:55.931442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.28418."}