{"as_of":"2026-08-11T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6372b979ecd2208ffcd7d67488f354dc16965eb311f46b33626b2ffce964eb78","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:10:23.901164Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T22:59:07.065193Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T22:59:34.279645Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"cited_work":{"arxiv_id":"2506.22396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22396","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quicksilver – speeding up LLM inference through dynamic token halting, KV skipping, contextual token fusion, and adaptive matryoshka quantization","venue":null,"work_id":"3e2e5ace-008e-4dd0-9ebd-b596025b17e6","year":2025},"citing_paper":{"arxiv_id":"2604.18592","last_updated":"2026-03-27T15:27:58Z","snapshot_observed_at":"2026-08-05T01:52:00.445011Z","submitted_at":"2026-03-27T15:27:58Z","title":"Two-dimensional early exit optimisation of LLM inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T22:59:07.065193Z"},"links":{"cited_paper":"/paper/2506.22396","citing_paper":"/paper/2604.18592"},"observation_digest":"sha256:5c82a35d959d8ca8aa92d50f2fb89ff4b1689e966c0c1fcb44623c7e6110c76f","observation_id":"c9037c0f-f0b6-4073-b2a2-f85c2c71e183","resolution":{"observed_at":"2026-05-14T22:59:34.284901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22396/citation-record","integrity":"/paper/2506.22396/integrity","json":"/paper/2506.22396/citation-record.json","paper":"/paper/2506.22396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:29.283412Z","title":"This \": processed all layers","venue":null,"work_id":"cda83b1b-e2a8-4f23-b389-18aeebfacbe5","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.644110Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:b1061711c0d85088e0263a455b0aa9caa04b9f9e1da954ed30159dc7a2d075ee","observation_id":"cbdea40f-a78e-4bf2-a233-45def0e3706a","resolution":{"observed_at":"2026-08-06T22:10:29.345819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:29.126402Z","title":"this \": KV diff 1.00 < 0.30 -> Write","venue":null,"work_id":"2b5c8fb8-2d20-4305-ba2a-d3a20ccaa75d","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.711859Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:8b000780fd88f1c0fd7607f9d678b20373f44610fd70bfbd2747db2fe10670fb","observation_id":"55d60984-3f8a-4332-ad5b-83b8aa8f4132","resolution":{"observed_at":"2026-08-06T22:10:29.210914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.965285Z","title":"This \" +","venue":null,"work_id":"269eef39-ee7d-4bf8-9c44-8ec945eaeb98","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.813508Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:041a89c77d2cb2cc983e57b604f6bb8a6764052af91ac5c33ce61f81a2f39ae6","observation_id":"ceffd707-cb7d-43bb-a4ab-7af4522662a4","resolution":{"observed_at":"2026-08-06T22:10:29.042472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-06T22:10:20.844437Z","title":"Charlie Chen, Sebastian Borgeaud, Geoffrey Irv- ing, Jean-Baptiste Lespiau, Laurent Sifre, and John Jumper","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.844437Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:c6322e1da2812daa28c082628ea98249d6d9651bb33cd644d0c1d25ce04ba615","observation_id":"f923ebb3-9e92-4cd0-9245-b8626840ec47","resolution":{"observed_at":"2026-08-06T22:10:20.844437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-06T22:10:20.927295Z","title":"In Proceedings of ICLR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.927295Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:94947f21543075f591242b8baf5b16908a147587ae288da9d834009bfbec36cc","observation_id":"7fc147b7-69e6-4816-baf2-79182af41f32","resolution":{"observed_at":"2026-08-06T22:10:20.927295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-06T22:10:20.989489Z","title":"In Proceedings of ACL","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.989489Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:372bbfd4719aab8825ee46936cd3e3ff85d00b0ce389dfb517d3cc03cc80ab15","observation_id":"d563ab34-0ddb-4def-8e66-9e57cdad4304","resolution":{"observed_at":"2026-08-06T22:10:20.989489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02001","last_updated":"2022-11-03T17:13:48Z","snapshot_observed_at":"2026-07-06T14:14:09.786628Z","submitted_at":"2022-11-03T17:13:48Z","title":"Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.02001","snapshot_observed_at":"2026-08-06T22:10:21.184745Z","title":"In Proceedings of the 58th Annual Meeting of the Association for Computational Lin- guistics (ACL), pages 6035–6044","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.184745Z"},"links":{"cited_paper":"/paper/2211.02001","citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:48c5e85a81b973c8c9a68b7ba664faaeba5f5e559da42aaf6f2804719a9e2488","observation_id":"10675910-233b-4717-b9d8-d1a0a413bb93","resolution":{"observed_at":"2026-08-06T22:10:21.184745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:29.619706Z","title":"OpenAI Blog","venue":null,"work_id":"5bf813f7-93b1-4659-a63f-4f038d72e5ff","year":2020},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.302545Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:c5793f50dd6075a2414485037476c14924c699e8db877b87b40063349c89f5ac","observation_id":"6e1305a7-c7ab-4ee0-80cc-4a5aeb0c3cb4","resolution":{"observed_at":"2026-08-06T22:10:29.706660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:29.439928Z","title":"Transactions of the Association for Computational Linguistics, 8:842–866","venue":null,"work_id":"48183120-43e3-48a3-b1c8-f34f6179147b","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.421070Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:1e1cec2df8e01803338d002817b05400c7be7ba69b4b67295f69d2b18d13a29c","observation_id":"9830d11b-602f-42ed-966e-906875262a7b","resolution":{"observed_at":"2026-08-06T22:10:29.525120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.806040Z","title":"and \": entropy 0.23 -> 2 - bit quant Token","venue":null,"work_id":"21390b33-c03f-4fdc-b658-14c9aee01b51","year":2020},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.931048Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:3019905ce88292c566b2bc264879a9569eb53c0915f1924527ca5c0b4b07dd0e","observation_id":"3005d7e8-64b6-4768-9db1-f58c93b9e6b5","resolution":{"observed_at":"2026-08-06T22:10:28.888395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.628770Z","title":null,"venue":null,"work_id":"60322ed0-c44a-43d1-9997-b5cbcfaa4546","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.027589Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:6bfbaba5842d827b7ca919bddbc103c7dff3f5aa27060703e86a450754d2537b","observation_id":"5de69b14-c194-45c1-8a33-36faf45a01f1","resolution":{"observed_at":"2026-08-06T22:10:28.721423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.287733Z","title":null,"venue":null,"work_id":"e0f75a67-46a9-4dc5-b30b-a45d739e34ba","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.088279Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:d7b163ae04522211281d7e54741509f16c95b9b608d29aecdf8dace360b05c67","observation_id":"70b860aa-9582-4900-a298-c52495bfbb84","resolution":{"observed_at":"2026-08-06T22:10:28.464567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.960401Z","title":"the, ” “of,","venue":null,"work_id":"38425e77-29e8-4a67-862d-2fff51dad47d","year":2001},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.152171Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:36e38ec31af97e184666d43654200c5bab87fbe67dc983907e6fe5f84e2e0dde","observation_id":"be1bc39a-c227-454f-9c9b-023fc1d7c74b","resolution":{"observed_at":"2026-08-06T22:10:28.130054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.626847Z","title":null,"venue":null,"work_id":"78d5270c-dde2-40fd-9c67-e468500c005f","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.225643Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:943f9f322675b4669c1e7f57d6d5757248891d38f3cb4e0a0654afbd2abe47eb","observation_id":"340a6210-5183-4572-bc9e-972aa58128c8","resolution":{"observed_at":"2026-08-06T22:10:27.797728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.387317Z","title":null,"venue":null,"work_id":"d56386e5-56a5-4b2b-b158-6f7c3ed7dec5","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.308022Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:8169de3b0c499f0caf2219ede3628afbf5c4fd03991d2e656a972e44b0d21c1a","observation_id":"8e967772-e3fd-432c-971b-ea39e29bc34a","resolution":{"observed_at":"2026-08-06T22:10:27.481988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.110761Z","title":"skipped after Layer 2","venue":null,"work_id":"2115d4cd-a19e-4a79-96ea-44d54992dd17","year":2000},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.378521Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:25f780ebc951155f6850f42889748769da034e0767acc0980087f35f61a70832","observation_id":"b44abbd4-911d-4b2d-8854-64d7dd03a1fb","resolution":{"observed_at":"2026-08-06T22:10:27.259969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.833619Z","title":null,"venue":null,"work_id":"49068170-bcd8-430c-bd8b-215d5787de15","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.475657Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:4bdb90963d20ebca323757a77aab9dc4f8a5fb05c69e160fdb8bcbedb861c83d","observation_id":"ac9c5c76-258e-483a-9422-72051c13e320","resolution":{"observed_at":"2026-08-06T22:10:26.990889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.486209Z","title":null,"venue":null,"work_id":"938ed008-f23a-40d2-b293-860fd635e27e","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.548011Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:8b0acf16714693b5a48aff5cf3c81440484fca8cb243d75e5b6f1fb36d954832","observation_id":"50b1b291-d620-430c-afe5-a794443dc6fb","resolution":{"observed_at":"2026-08-06T22:10:26.661016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.157431Z","title":null,"venue":null,"work_id":"9af113b6-f197-45de-8d9d-63fe6263b554","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.634481Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:ab18634e3f1a2b1c4ece82bb5cfb1b09d16e94d9e74370578e91e1768a439209","observation_id":"ff59b215-10fa-4728-a5df-f16c00033a54","resolution":{"observed_at":"2026-08-06T22:10:26.307801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.825088Z","title":"This conservative threshold ensures fusion only when representational collapse is semantically safe","venue":null,"work_id":"babcc8fb-0fb1-43c8-bebf-942723a6f670","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.724335Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:36a1d1e49b151898e1c465b3b3ce56802454ac891cb1afc615fc2eca59b181d8","observation_id":"320abb27-1600-4517-9b8f-8980131a5ebe","resolution":{"observed_at":"2026-08-06T22:10:26.002069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.665723Z","title":null,"venue":null,"work_id":"12f09a1e-3af4-4ac2-a708-a7509679857b","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.804178Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:e3b984218ec516cdbfb2c0ddde0e04f7d269a9c6b372a9f7c31323e78e201a57","observation_id":"13489094-6c33-4013-9521-78b40884a72b","resolution":{"observed_at":"2026-08-06T22:10:25.699415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.528378Z","title":"We choose the pair (τlow, τhigh) = (0.3, 0.6) that achieves a strong Pareto frontier: ∼ 8.6% additional FLOP reduction with less than 0.1 perplexity change","venue":null,"work_id":"bc55ce43-9852-4a72-a3a4-89013304e02d","year":2022},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.902853Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:8590bc81d5c1796b469a910498ac79c62f29f421c0520b181fda4721f4c3ccae","observation_id":"a3a64abf-0ac8-46a2-bd14-9a857917d78e","resolution":{"observed_at":"2026-08-06T22:10:25.606207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.405564Z","title":null,"venue":null,"work_id":"595fc16e-882a-4840-9e91-1a9044251258","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.970994Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:a96e9cde7908b53810dcb435334190eadb8224e23145c244a96d4d201e6ffc57","observation_id":"dff6614e-5875-45ae-b55d-43a4879dbd19","resolution":{"observed_at":"2026-08-06T22:10:25.456484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.271911Z","title":null,"venue":null,"work_id":"88544cc6-2971-4949-bb88-62705a6438bc","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.067941Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:94a138e4175a200a38cb7dd1703d096cba08515f84fb31a6d261f83596112207","observation_id":"9b1963e1-8a94-4e7c-b5d8-77fe94faa165","resolution":{"observed_at":"2026-08-06T22:10:25.334389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.139485Z","title":"Pareto Surface Analysis","venue":null,"work_id":"e038ef54-e768-4714-ba72-024261a0180b","year":2022},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.157049Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:a167bf409ba72e7fefd2c4d6117677701261c334795f6a783d326f82cede9fa3","observation_id":"5780c87f-a0be-4ef7-aac8-637ceecbbc95","resolution":{"observed_at":"2026-08-06T22:10:25.204098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.014655Z","title":null,"venue":null,"work_id":"d37845eb-8e5a-4205-8dfe-da4c7d1d976b","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.292848Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:a87e4fad596620a31fb15bfcd1700d1d03375b3f12d829922eb715632c0228c3","observation_id":"2632d43f-6fdb-40dc-a5a3-e86ccce7e131","resolution":{"observed_at":"2026-08-06T22:10:25.073338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.876083Z","title":null,"venue":null,"work_id":"bb528840-b97c-4dd2-9140-6df4a756cd97","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.410599Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:598e3fa57be132abd9a97be4706e710e678cd990128783d22f4d36ccc7ade596","observation_id":"5a48624b-df50-437f-a210-2fa41d532593","resolution":{"observed_at":"2026-08-06T22:10:24.929281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.769724Z","title":"We hope this work encourages the community to adopt tools like CodeCarbon not as post-hoc profil- ers, but as first-class citizens in the deployment pipeline","venue":null,"work_id":"6047992b-af08-4a0b-a881-1b55a7bea3aa","year":2018},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.502380Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:91bcef0ea95b1a5d18bb5738b7a5231608f3099b96ef155354bfe4bf2180bc38","observation_id":"109bdff8-33a9-4348-a66a-093ce5cc00fb","resolution":{"observed_at":"2026-08-06T22:10:24.813090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.652067Z","title":"I.2 holds, halt the token unconditionally","venue":null,"work_id":"6109da42-08a8-44f1-901d-c901859ce0d4","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.588970Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:fd502471cba3ec382bb9073c7a7a41fb6a65212f3b410ca204f0fc03e6859b8b","observation_id":"21bf7a74-74a1-40a4-88b5-0dc614ac3f85","resolution":{"observed_at":"2026-08-06T22:10:24.715856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.534851Z","title":"I.3 holds for any u, merge (t, u)","venue":null,"work_id":"769736df-6d5f-4de8-9dcb-e763c4388807","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.675410Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:b6e54a4efc0aece082d53fe911e00f8f5fab87ebf4231b3d8b150f8ba90834d0","observation_id":"7f17e496-1fa0-4250-a091-099349017816","resolution":{"observed_at":"2026-08-06T22:10:24.575835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.420641Z","title":"This priority is grounded in halting the provision of computational savings without representational loss, while fusion entails approximation","venue":null,"work_id":"c37c5780-9aa4-4ce1-96ba-d0a995b06c55","year":2020},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.769522Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:99e5f9023cad724993c4661dceb34068e06d6ec1379e126c59b85aa390a616aa","observation_id":"6a014c21-1968-4921-a1bf-73f7835c4458","resolution":{"observed_at":"2026-08-06T22:10:24.483090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.250724Z","title":"the”, “of","venue":null,"work_id":"724a95f5-f8dd-4e86-b076-17c7ea58a3fb","year":2001},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.831764Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:aa6b93de2cbf804cec472e7dc2732c79f517e8cacfe59861fef6672172b7f62b","observation_id":"a247a1bb-80cf-4184-a20b-6a4175ef868f","resolution":{"observed_at":"2026-08-06T22:10:24.333934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.080150Z","title":"tokens","venue":null,"work_id":"0dbbd110-0bbc-49a2-ae22-e054fb34b7c8","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.901164Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:f9eb5efe9d094d238d4ae5a01b5767ed2ed8fbda177bff326f09599b8c909633","observation_id":"53f694ef-434c-44fb-8cba-210f44d7265b","resolution":{"observed_at":"2026-08-06T22:10:24.153732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:29.800908Z","title":"Shaojie Bai, J Zico Kolter, and Vladlen Koltun","venue":null,"work_id":"b121812d-b8eb-4bc8-b6f3-2e493ed76da5","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.558635Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:1f73b0c9611f97267f11f8f1e1d52c1052d7ae12787b3a3e4f139aa4e9710aef","observation_id":"049f2228-6a3f-4ccf-86d7-8905790b5e24","resolution":{"observed_at":"2026-08-06T22:10:29.876336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-06T22:10:21.087718Z","title":"Dan Klein and Christopher D","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.087718Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:6e9802ab91ebb591ddc88356e8ed583c21f742443045d7e5ae240ad4e56b999d","observation_id":"76f29783-9953-4308-a35a-b0f1be593238","resolution":{"observed_at":"2026-08-06T22:10:21.087718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:29.967744Z","title":"In International Conference on Machine Learning (ICML)","venue":null,"work_id":"dc3f6e46-7425-4a80-9b4a-cec50dfd12f4","year":null},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.466955Z"},"links":{"citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:00e9117b6f44a0458d94f149dd04d23f0b5e549ee49a590dccc666d741111441","observation_id":"f82ae740-22a5-4662-835f-af65acadd9b6","resolution":{"observed_at":"2026-08-06T22:10:30.034930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05723","last_updated":"2019-05-29T08:45:02Z","snapshot_observed_at":"2026-08-10T13:05:54.969982Z","submitted_at":"2018-10-02T15:10:44Z","title":"Post-training 4-bit quantization of convolution networks for rapid-deployment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05723","snapshot_observed_at":"2026-08-06T22:10:20.694641Z","title":"In Interna- tional Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.694641Z"},"links":{"cited_paper":"/paper/1810.05723","citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:ed05ab46f7a2154e77cfac0bba434f7340efba534727cac0c89e8897214e5713","observation_id":"aa67e5e7-8c7a-4cbc-8cd2-f5f616578b5c","resolution":{"observed_at":"2026-08-06T22:10:20.694641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-06T22:10:21.546065Z","title":"the\", \"in","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.546065Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2506.22396"},"observation_digest":"sha256:bc7f8e1188b031f5c79637e3af95a59ef62ee3cd30495fbba0c9686ef78d5d5e","observation_id":"9daf933b-ddf0-44b3-9907-a617827aab08","resolution":{"observed_at":"2026-08-06T22:10:21.546065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22396","last_updated":"2025-06-27T17:10:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T18:04:40.898016Z","submitted_at":"2025-06-27T17:10:32Z","title":"QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2506.22396."}