{"as_of":"2026-08-08T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32e53874229ad5caf37813b86c8d66090a0c1d1190a661a95a6612eb73d2b66b","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:52:44.664299Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.01190/citation-record","integrity":"/paper/2509.01190/integrity","json":"/paper/2509.01190/citation-record.json","paper":"/paper/2509.01190"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-05T12:52:44.609841Z","title":"Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al- Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Alex Vaughan, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.609841Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:4106b9b60b3d3b43c4016fd9463859e9a9e18267500ad0b88796d05afb19450f","observation_id":"bfa35c9f-fdef-4003-9f08-d30a3be4ddf8","resolution":{"observed_at":"2026-08-05T12:52:44.609841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09266","last_updated":"2023-05-08T13:05:00Z","snapshot_observed_at":"2026-07-06T15:04:11.708950Z","submitted_at":"2023-03-16T12:44:16Z","title":"SmartBERT: A Promotion of Dynamic Early Exiting Mechanism for Accelerating BERT Inference","version":2},"cited_work":{"arxiv_id":"2303.09266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09266","snapshot_observed_at":"2026-08-05T12:52:44.753747Z","title":"SmartBERT: A Promotion of Dynamic Early Exiting Mechanism for Accelerating BERT Inference","venue":"cs.CL","work_id":"af34bf0e-8b7e-4247-964c-0c562664ce8c","year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.629911Z"},"links":{"cited_paper":"/paper/2303.09266","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:1cd010c4a13f8c261375c68405afb3487b864b081222d313cc1d9f99fe213e0b","observation_id":"9617c512-fa86-40b4-ac56-e644275340ea","resolution":{"observed_at":"2026-08-05T12:52:44.760293Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:45.005960Z","title":"Heejun Lee, Minki Kang, Youngwan Lee, and Sung Ju Hwang","venue":null,"work_id":"48bb0571-1278-48b6-b12b-3b5a4e8b3a30","year":2022},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.636353Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:737ce3010a521d8d31f5610c450a9c26682622cb8828d1992d10f6b638e6708c","observation_id":"fe5ab983-814a-450f-90b0-d9eca33518af","resolution":{"observed_at":"2026-08-05T12:52:45.011281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06619","last_updated":"2023-09-12T22:22:10Z","snapshot_observed_at":"2026-07-06T16:17:43.448660Z","submitted_at":"2023-09-12T22:22:10Z","title":"RT-LM: Uncertainty-Aware Resource Management for Real-Time Inference of Language Models","version":1},"cited_work":{"arxiv_id":"2309.06619","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.06619","snapshot_observed_at":"2026-08-05T12:52:44.714207Z","title":"RT-LM: Uncertainty-Aware Resource Management for Real-Time Inference of Language Models","venue":"cs.LG","work_id":"ccbc0968-b0bf-42f3-8350-cac03871a4e3","year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.641875Z"},"links":{"cited_paper":"/paper/2309.06619","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:496cdad490aec19859c7206355642ed3ef1fad09492297df5c8ecc3c4c911ed2","observation_id":"d5bd6782-a633-4b16-9a0c-2db2ab7e5628","resolution":{"observed_at":"2026-08-05T12:52:44.721825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.963186Z","title":"InProceedings of the 16th conference of the European chapter of the association for computational linguistics: Main V olume, pages 91–104","venue":null,"work_id":"dcc50997-f1f2-4a90-b548-6a9ae9b67f9e","year":2020},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.654033Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:2ff532ce33c2c669b9796568a7cb8f127297c8630915fdff1db7b43366835a13","observation_id":"3e917123-a917-467e-bf33-8a4af29a9b71","resolution":{"observed_at":"2026-08-05T12:52:44.971096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.933224Z","title":"In 2023 60th ACM/IEEE Design Automation Confer- ence (DAC), pages 1–6","venue":null,"work_id":"0baa0683-7db8-4071-9c9b-8a44f68d780d","year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.658328Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:055308aaeb89aedec570c57d8ce105739fb07642c35f0640464f253d50413397","observation_id":"cf8f6fb1-49bb-4c5b-b2fd-b5ac5bbf8d0d","resolution":{"observed_at":"2026-08-05T12:52:44.938126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.911267Z","title":"Blue squares represent preserved tokens, white squares represent pruned tokens, and the red line indicates the overall preservation trend per layer","venue":null,"work_id":"5044e3e6-33aa-4c84-9e70-47beaa172786","year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.664299Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:d1255b0a5509b0e25d496c8864052202dc43697d9f9413ec8d4b06a73c2273b7","observation_id":"107c0efa-055e-4229-8830-5e8482b3c100","resolution":{"observed_at":"2026-08-05T12:52:44.917986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T12:52:44.604653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.604653Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:b6546a774533aab051b29a5a2669073376c6d4e3cf21053ebf05f6a9cd6c6e03","observation_id":"c16095b2-c899-494f-9a47-984c45f04b98","resolution":{"observed_at":"2026-08-05T12:52:44.604653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T12:52:44.623223Z","title":"Bodun Hu, Jiamin Li, Le Xu, Myungjin Lee, Ak- shay Jajoo, Geon-Woo Kim, Hong Xu, and Aditya Akella","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.623223Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:2cfce3303858b2b23ca46da41e87f1e8e77e1f0ad28bc17670d8737b926ce582","observation_id":"aecc832f-0f19-45a3-b2b6-e1f0bdcfac3d","resolution":{"observed_at":"2026-08-05T12:52:44.623223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.985478Z","title":"InICASSP 2021-2021 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 7713–7717","venue":null,"work_id":"f93db3d8-e6f2-4290-a5ef-d16bd31d1a0a","year":2021},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.649209Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:bdf842af84d8f043baf61f63ce46af85c44f627f26856da5c0975b449e89e2c6","observation_id":"f0b1ab8e-093c-472a-a808-1026bf03a6c1","resolution":{"observed_at":"2026-08-05T12:52:44.992848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T12:52:44.591356Z","title":"Tianle Cai, Yuhong Li, Zhengyang Geng, Hongwu Peng, Jason D Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.591356Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:caf8eb191b171aa48c338aed42a7a96f99cba8c37a9d6110677e9bf9667a86cc","observation_id":"379ad255-dff5-4788-8671-cd5f7f99c0d7","resolution":{"observed_at":"2026-08-05T12:52:44.591356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12023","last_updated":"2024-08-27T00:48:35Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T18:57:41Z","title":"LQ-LoRA: Low-rank Plus Quantized Matrix Decomposition for Efficient Language Model Finetuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12023","snapshot_observed_at":"2026-08-05T12:52:44.617762Z","title":"arXiv preprint arXiv:2311.12023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.617762Z"},"links":{"cited_paper":"/paper/2311.12023","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:3ce877d9b691dee26add960d4f5d4c4bb10d62df8171e1654fbc2ab0645440d5","observation_id":"1eed93bd-164e-4734-afbc-880163b626f3","resolution":{"observed_at":"2026-08-05T12:52:44.617762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-05T12:52:44.599095Z","title":"org/abs/2401.10774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.599095Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:ab0abcc0590db4e4004e301c4ada8104de93a2df71ed19b0272d8aa55a973964","observation_id":"8bfc1734-8aa2-4359-a406-3592205cbe19","resolution":{"observed_at":"2026-08-05T12:52:44.599095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T12:52:43.458130Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2509.01190."}