{"as_of":"2026-08-06T19:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe60a41e6d931a49b53e15ffd2fc0321e767968b034b288e569b19384d2246a7","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:20:10.699246Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.10453/citation-record","integrity":"/paper/2605.10453/integrity","json":"/paper/2605.10453/citation-record.json","paper":"/paper/2605.10453"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-07-06T14:25:12.946406Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2211.17192","doi":"10.48550/arxiv.2211.17192","metadata_source":"pith","pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Inference from Transformers via Speculative Decoding","venue":"cs.LG","work_id":"a17596db-fb15-4793-9ce6-fc620a92ae36","year":2022},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:8307f046b08db969dd05ba1dd21ac3dda27a160ce600690d8c87607867337bed","observation_id":"361ff772-ef36-4b9e-aa3d-446031e2b23d","resolution":{"observed_at":"2026-05-17T22:52:00.384886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":"2302.01318","doi":"10.48550/arxiv.2302.01318","metadata_source":"pith","pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","venue":"cs.CL","work_id":"b53b11e5-8613-439d-9d9d-0e2a9090d79f","year":2023},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:5ad17b180ffbeb708ca6c2f157bf7329615d51a2a1e22efa1cc1078629bf53cd","observation_id":"ccc5f5b2-3075-4cf4-a253-b8ac0304b7de","resolution":{"observed_at":"2026-05-12T04:21:19.677392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rest: Retrieval-based speculative decoding","venue":null,"work_id":"f7578ec6-d755-4ed4-a653-86acad852972","year":2024},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:7ae26aa5ef854f757f585326fbb681f4efa697511dbceb67c49976964610a9f8","observation_id":"111d67bd-cf9a-4158-a49f-2dc6902fd25b","resolution":{"observed_at":"2026-05-12T15:36:39.856446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Break the sequential dependency of llm inference using lookahead decoding","venue":null,"work_id":"14cb524c-a404-498e-b5ec-c868eda66e6a","year":2024},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:5ed25890d5596018b469d6a9fef0cfc99bfc25ff8e9f777d8a30d247dc807b97","observation_id":"5657564f-ea12-4736-b578-e4043d3aaa66","resolution":{"observed_at":"2026-05-12T15:36:39.853047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":"2401.10774","doi":"10.48550/arxiv.2401.10774","metadata_source":"pith","pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","venue":"cs.LG","work_id":"f6202cd1-1a78-4c19-8242-688acf4952b6","year":2024},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:9ecd4676ed1cd7f7bd8c0c2c92852c7ade4abaf61a032ac2f8dde5d32a8de2e7","observation_id":"7d7e599d-4b35-4c9e-87e2-9b0f6cdb23ca","resolution":{"observed_at":"2026-05-13T10:36:18.892007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05109","last_updated":"2024-10-07T16:21:29Z","snapshot_observed_at":"2026-08-03T23:07:15.667650Z","submitted_at":"2024-02-07T18:58:50Z","title":"Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding","version":2},"cited_work":{"arxiv_id":"2402.05109","doi":"10.48550/arxiv.2402.05109","metadata_source":"pith","pith_arxiv_id":"2402.05109","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hydra: Sequentially-dependent draft heads for medusa decoding","venue":"cs.LG","work_id":"e51f556b-4111-49b3-96b0-6191c097ea33","year":2024},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2402.05109","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:434ecfc8222114f2ce06e528a2c900c40142c297d94d628ebf23c6754be6c27f","observation_id":"ec8a8335-e233-480a-b314-c7a57435e7be","resolution":{"observed_at":"2026-05-12T04:21:19.680951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":"2401.15077","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-07-10T21:57:38.979373Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","venue":"cs.LG","work_id":"9d4637dd-1cab-4f10-82d4-8c8d14bb96ed","year":2024},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:e3a40915007612586847f1267b18e359647e63fcd621b8a95a9c376de5771539","observation_id":"0ed16580-b96d-4082-869a-f792164d386a","resolution":{"observed_at":"2026-05-15T00:15:49.524886Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16858","last_updated":"2024-06-30T15:03:25Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:11Z","title":"EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees","version":2},"cited_work":{"arxiv_id":"2406.16858","doi":"10.48550/arxiv.2406.16858","metadata_source":"pith","pith_arxiv_id":"2406.16858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eagle-2: Faster inference of language models with dynamic draft trees","venue":"cs.CL","work_id":"373baad2-322f-4573-8ba2-d7559e15d07b","year":2024},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2406.16858","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:b54a75e4d0d5db78f7d986d21938ff55ddef4967f1e749b5497aebf4e5c54e84","observation_id":"573b0795-90f4-4be7-8532-f59e9039b5c7","resolution":{"observed_at":"2026-05-12T04:21:19.693734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":"2503.01840","doi":"10.48550/arxiv.2503.01840","metadata_source":"pith","pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","venue":"cs.CL","work_id":"323c1b68-aec5-4444-944f-155a771bd8c6","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:1c2e879efa2319f1233f76d8e1be9764c49e4604dd271c8049712c2ade77b69f","observation_id":"a4fd9def-5d8d-422b-b785-148f6f9023d1","resolution":{"observed_at":"2026-05-15T18:52:19.804345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":"2503.01840","doi":"10.48550/arxiv.2503.01840","metadata_source":"pith","pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","venue":"cs.CL","work_id":"323c1b68-aec5-4444-944f-155a771bd8c6","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:d494d0a8dece4e9b38db7d3d8f705e094e0833442d151e317c357d9aff43cc86","observation_id":"6ec53610-7ffe-44a1-bd5f-f8f61b07ac6e","resolution":{"observed_at":"2026-05-15T18:52:19.804345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14856","last_updated":"2025-03-11T08:54:55Z","snapshot_observed_at":"2026-07-06T20:40:01.776087Z","submitted_at":"2025-02-20T18:58:10Z","title":"FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling","version":2},"cited_work":{"arxiv_id":"2502.14856","doi":"10.48550/arxiv.2502.14856","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fr-spec: Accelerating large-vocabulary language models via frequency-ranked speculative sampling","venue":"ArXiv.org","work_id":"02b844f3-122a-4850-a15a-870620a3ce01","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2502.14856","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:2ea2b6d346ec8f0426c74b066b307cecd0a0d314aee8200d5fb472d29cc4d0a2","observation_id":"6c3762d7-199d-4325-926b-db67d973baf5","resolution":{"observed_at":"2026-05-12T04:21:19.662958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13836","last_updated":"2026-07-17T14:00:00Z","snapshot_observed_at":"2026-08-05T20:19:39.577871Z","submitted_at":"2026-02-14T16:10:00Z","title":"Speculative Decoding with a Speculative Vocabulary","version":2},"cited_work":{"arxiv_id":"2602.13836","doi":"10.48550/arxiv.2602.13836","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.13836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwon, Rui Li, Alexandros Kouris, and Stylianos I","venue":"Open MIND","work_id":"603cb14e-506c-4591-98ca-d02e8516e6bf","year":2026},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2602.13836","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:903b1916d79161483b9d05c98e92d108b660f4d4b4e76e0963b80cefcedfbf91","observation_id":"2ecbdda1-8021-48f8-8bc2-cae83ba80816","resolution":{"observed_at":"2026-07-20T03:19:15.112310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.22694","doi":"10.48550/arxiv.2506.22694","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V ocabtrim: V ocabulary pruning for efficient speculative decoding in llms","venue":"ArXiv.org","work_id":"8be28270-4839-4f1c-ac5c-24a077cd9cea","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:119f36822d2e688bb2fa350a7b241fa0d91229b21fab57175c8962710ad0a3f8","observation_id":"bcb265b0-e186-421b-9f16-781bd95d5efd","resolution":{"observed_at":"2026-05-12T04:21:19.626763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05210","doi":"10.48550/arxiv.2603.05210","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Balancing coverage and draft latency in vocabulary trimming for faster speculative decoding","venue":"Open MIND","work_id":"3abe945b-094e-494d-a3c7-f64e443c8a1f","year":2026},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:de922eae588de9e6e44d65571971276987d7190b79ae797c8dc37aa20baf7cd0","observation_id":"1409bf96-ab96-4cc4-8a3f-b89821a6a44c","resolution":{"observed_at":"2026-05-12T04:21:19.618564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16880","last_updated":"2025-05-25T14:16:22Z","snapshot_observed_at":"2026-08-03T23:38:45.873467Z","submitted_at":"2025-02-24T06:28:26Z","title":"CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative Drafter","version":3},"cited_work":{"arxiv_id":"2502.16880","doi":"10.48550/arxiv.2502.16880","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.16880","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Coral: Learning consistent representations across multi-step training with lighter speculative drafter","venue":"ArXiv.org","work_id":"ad828ef6-c484-4710-a758-29a599cf8edc","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2502.16880","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:53aec07d4f19c46d2c938f56a43eeb171986aaf1434d47a77e2485201f2d2325","observation_id":"2e0e6631-e7b6-4ff8-9e67-7f9f6417692a","resolution":{"observed_at":"2026-05-12T04:21:19.645759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13847","doi":"10.48550/arxiv.2510.13847","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dynaspec: Context- aware dynamic speculative sampling for large-vocabulary language models","venue":"Open MIND","work_id":"08e3cbc1-91b9-485b-8cf7-dce35e73b9eb","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:fb40b5e1dbf10c60fa3d862a441fc27914e6a0fa92642563906c1ebf56f42509","observation_id":"be687de8-f0b1-4852-9d11-a303af35853f","resolution":{"observed_at":"2026-05-12T04:21:19.649305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.23881","last_updated":"2026-06-01T13:21:18Z","snapshot_observed_at":"2026-08-05T12:10:20.875922Z","submitted_at":"2026-02-27T10:20:11Z","title":"LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2602.23881","doi":"10.48550/arxiv.2602.23881","metadata_source":"pith","pith_arxiv_id":"2602.23881","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Samarin, S","venue":"cs.LG","work_id":"3807cc54-6e95-4909-9f3c-f9cb4bc1b2a5","year":2026},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2602.23881","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:44d6e95048ced43a5fb6384dbd3f94ee619617d0c4a997ebaf62c77e75c64e9e","observation_id":"bf01861e-9a63-4e80-a209-10bcd944a482","resolution":{"observed_at":"2026-06-02T04:04:29.221763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03206","last_updated":"2025-06-02T21:08:02Z","snapshot_observed_at":"2026-07-06T21:36:01.328140Z","submitted_at":"2025-06-02T21:08:02Z","title":"Out-of-Vocabulary Sampling Boosts Speculative Decoding","version":1},"cited_work":{"arxiv_id":"2506.03206","doi":"10.48550/arxiv.2506.03206","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03206","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Out-of- vocabulary sampling boosts speculative decoding","venue":"ArXiv.org","work_id":"1f52ba11-c874-4a6c-9074-e37120f26d81","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2506.03206","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:36677ae3f931e34074459d4b6815ae723aacada42c416c43ccc35456b01bb970","observation_id":"b16d51d8-7c0a-4c41-ada8-f1a1730a9ec6","resolution":{"observed_at":"2026-05-12T04:21:19.669836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient softmax approximation for GPUs","venue":null,"work_id":"16152a49-607d-4e5c-af05-45f1a89f8d14","year":2017},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:6dbd331d8f2f0f74e077d5185ac8f59f1ace07a3096e20f9d07892d3e3b43e43","observation_id":"b9806f5f-c238-4107-8892-d544accaa9a3","resolution":{"observed_at":"2026-05-12T15:36:39.839758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, Si Si, Yang Li, Ciprian Chelba, and Cho-Jui Hsieh","venue":null,"work_id":"3ad221f7-5300-48f3-a439-0887377b365c","year":2018},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:5d54b1ceca48eac32327011293bea02847f17f6a6b8f9184e81bcf450616bb1c","observation_id":"14c1fab1-8d0a-4d50-ad9a-f5a85696d92c","resolution":{"observed_at":"2026-05-12T15:36:39.829456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive input representations for neural language modeling","venue":null,"work_id":"2d743add-724c-4654-a4ee-25062991bff6","year":2019},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:8b3675cacf49336a52c134dc263b435152f4488d718f0bdaee5f41ede3122969","observation_id":"b253cd08-1cc4-47b6-8741-005388a9ccd4","resolution":{"observed_at":"2026-05-12T15:36:39.833208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.06720","last_updated":"2020-11-10T22:59:44Z","snapshot_observed_at":"2026-08-06T14:13:09.060706Z","submitted_at":"2019-10-02T16:40:03Z","title":"Improving Word Embedding Factorization for Compression Using Distilled Nonlinear Neural Decomposition","version":2},"cited_work":{"arxiv_id":"1910.06720","doi":"10.48550/arxiv.1910.06720","metadata_source":"arxiv_reference","pith_arxiv_id":"1910.06720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving word embedding factorization for compression using distilled nonlinear neural decomposition","venue":"arXiv (Cornell University)","work_id":"cc8ddbc3-3c88-4ca5-add7-99ba83d2e569","year":1910},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/1910.06720","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:7c8f6bb4bed1e9af93d928d31f56c90a1458eeb42053e18b340401fc170c7df7","observation_id":"a3c2071e-fb99-4ad9-a2e1-d1c49e5bf3cf","resolution":{"observed_at":"2026-05-12T04:21:19.659498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tensorized embedding layers","venue":null,"work_id":"b7840d34-fbc4-467e-93ec-e7ca50702702","year":2020},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:baeed5799b84d132fa8a01909c25519a4a33e5db0b6201259bb65768d3d3efe8","observation_id":"66b08d96-c402-4cd4-bdd5-3e07b6f992f2","resolution":{"observed_at":"2026-05-12T15:36:39.842967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ALBERT: A lite BERT for self-supervised learning of language representations","venue":null,"work_id":"de5ad9f5-c5fc-49e2-9eea-0c8f1f15c3d3","year":2020},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:fba293685dda1215217016fb049cc076f72097244bbecfa2fc32a95a3cb9a997","observation_id":"6a750851-ae11-4c58-b212-d13fd462e4fb","resolution":{"observed_at":"2026-05-12T15:36:39.836430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning meets projective clustering","venue":null,"work_id":"a337f99c-8933-40ce-baf5-e7e728c1c2c5","year":2021},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:ce40a8d5a04e5560ddcb33e224b4b422a9cc71e4249c5a0bf3d07aa2521df1f4","observation_id":"4f7e45ae-12f3-4220-992a-24f501ebc9f8","resolution":{"observed_at":"2026-05-12T15:36:39.846107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slimpajama: A 627b token cleaned and deduplicated version of redpajama.Cerebras Systems","venue":null,"work_id":"a1fd7a40-9acf-4e87-8f8d-347647cfac95","year":2023},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:bb73d5b2a0201422a278a0f34b81d11918a7e97e7a8d01ecea365c70a8a1d343","observation_id":"c7b1500e-ab8d-493f-933a-5117d268b10f","resolution":{"observed_at":"2026-05-12T15:36:39.849458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:8b6c20ade5a6907614e409e3cf73f81c2290671729d1e49340b614ccb083f1b4","observation_id":"b6e6532a-12b7-4135-8d7b-1c00dc6bc8ec","resolution":{"observed_at":"2026-05-12T04:21:19.641647Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:958dd0e21970dbdc0262398770a6ef9c808cd24709f20f9d40d9545a5e759ff5","observation_id":"20b2a1a9-a07b-4494-9bca-04b5198d9c2c","resolution":{"observed_at":"2026-05-12T04:21:19.634590Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:12cc448cd6339c25da5a69b8fa1462bb95bcd3d092647cbbe6e30dca8e3419e2","observation_id":"691cbfa7-faf3-4961-826e-ec02f3568c06","resolution":{"observed_at":"2026-05-12T04:21:22.770749Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11116","last_updated":"2025-06-09T06:37:15Z","snapshot_observed_at":"2026-07-06T21:41:19.199391Z","submitted_at":"2025-06-09T06:37:15Z","title":"Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models","version":1},"cited_work":{"arxiv_id":"2506.11116","doi":"10.48550/arxiv.2506.11116","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11116","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Infinity Instruct: Scaling instruction selection and synthesis to enhance language models","venue":"ArXiv.org","work_id":"728884e2-e6cf-4dc9-a9ce-0c8146038e70","year":2025},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2506.11116","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:1232d83e84a2d59b20d80b3559133265cb456de956f9c7fb54482a4a0654da8e","observation_id":"8dbe3302-ad9a-498f-98f2-0913806169ba","resolution":{"observed_at":"2026-05-12T04:21:19.630771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:9dcdafe454cace29e6106d2987a81a80747e6c4df6141f07d209fe20ce48d8e0","observation_id":"66250d86-6cf7-441b-a44e-60c3a925051a","resolution":{"observed_at":"2026-05-12T04:21:22.774995Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:6da088f1ecc4771fc58e633264810ec654b4adfbab14c224ed1025db6394a639","observation_id":"f9876da7-1886-42f3-ba78-f6bed18f952f","resolution":{"observed_at":"2026-05-12T04:21:19.666003Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:74d0f5ad308d93a89f225b8315b953d602b2da0766ac0ee425104133f5132697","observation_id":"8bfe7611-276f-46b1-97da-cc5fa3eb11c4","resolution":{"observed_at":"2026-05-12T04:21:22.757526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:ff4a61c8fbcc90623258d57f6df3b016b2cd8b5a6848cf4a94c4878001318277","observation_id":"f41f0926-f7e4-46f6-9ea6-7e8609cc10be","resolution":{"observed_at":"2026-05-12T04:21:19.622747Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:cfe26965af51e12216ea2cbb38dd35f5b4c1019fce2ca16b48c00362c1385bf9","observation_id":"27c170bd-f72f-43c9-8b47-01c502d76fe0","resolution":{"observed_at":"2026-05-12T04:21:22.762802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:10.699246Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.10453"},"observation_digest":"sha256:501de44da52403c504e7448671d1e011eb3b1efe73ac82d27ed6f4ca7aad2026","observation_id":"9216f5a7-4bd7-4700-9792-53001493ebf5","resolution":{"observed_at":"2026-05-12T04:21:19.655283Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.10453","last_updated":"2026-05-11T12:22:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:22:37Z","title":"SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":3,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":0,"verified_exact":17,"verified_fuzzy":9},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2605.10453."}