{"as_of":"2026-08-09T09:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e824e1e841952e2f08697de9a4f93533e051eeaf2bff254f7f396254444d3152","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:55:41.247033Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13735/citation-record","integrity":"/paper/2607.13735/integrity","json":"/paper/2607.13735/citation-record.json","paper":"/paper/2607.13735"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-02T03:55:39.877162Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads.arXiv preprint arXiv:2401.10774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:39.877162Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:c70f477009e3006f1d86c12c711c230b342a889e6a0a03d85faf5c15ec2b4dc2","observation_id":"64528687-9085-466a-988c-25f3391937f9","resolution":{"observed_at":"2026-08-02T03:55:39.877162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-08T23:08:43.190961Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-02T03:55:40.314783Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.314783Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:c5520c54267250f95e8eda591cbd22e258cfcbc05ab6483ce7e669a9e4887820","observation_id":"c93a4183-b56e-4ef5-ab2f-0cba141bdf49","resolution":{"observed_at":"2026-08-02T03:55:40.314783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T03:55:40.433775Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.arXiv preprint arXiv:2401.18079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.433775Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:5a36496c23a96f8c15b2c4e29aaafba60eef9de4f2bc8ce664203b3477617f5b","observation_id":"370400af-5b24-4d45-9b3e-a0fe5069a658","resolution":{"observed_at":"2026-08-02T03:55:40.433775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02784","last_updated":"2023-12-13T13:29:29Z","snapshot_observed_at":"2026-08-07T14:05:57.857217Z","submitted_at":"2023-09-06T06:51:15Z","title":"Norm Tweaking: High-performance Low-bit Quantization of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02784","snapshot_observed_at":"2026-08-02T03:55:40.548166Z","title":"Norm tweaking: High-performance low-bit quantization of large language models.arXiv preprint arXiv:2309.02784, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.548166Z"},"links":{"cited_paper":"/paper/2309.02784","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:fbe3dfb5bf44feefab6d450c84f71e7f8881f04d2db709e1b5f24685c0e99186","observation_id":"db20af93-eb7e-4b9b-8bb2-9d879a52b75d","resolution":{"observed_at":"2026-08-02T03:55:40.548166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-08-07T18:58:35.737110Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-08-02T03:55:40.665371Z","title":"Llm-qat: Data-free quantization aware training for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.665371Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:81a454c865f0b4edaa0b07f47866e3b2cf496f87f601fc89979cf678dad438de","observation_id":"19cb1add-ad6b-41f6-ae63-a819d29e2108","resolution":{"observed_at":"2026-08-02T03:55:40.665371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-02T03:55:40.779355Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache.arXiv preprint arXiv:2402.02750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.779355Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:8064114f4bbe9020fc3a99b5b0d3a6e2c22329cc3731cc53f5432aef065ff5ad","observation_id":"eda8e874-d59f-4343-a954-423ffee4a1c1","resolution":{"observed_at":"2026-08-02T03:55:40.779355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:55:40.897846Z","title":"Distilling reasoning capabilities into smaller language models.Findings of the Association for Computational Linguistics: ACL 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.897846Z"},"links":{"citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:3110ab4c84229f0f39409ab2e270d12b480624a80761bfe3bcd16019db6df881","observation_id":"74f57f1b-a497-4f8b-a34a-3c9c416713ae","resolution":{"observed_at":"2026-08-02T03:55:40.897846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-02T03:55:41.015173Z","title":"A simple and effective pruning approach for large language models.arXiv preprint arXiv:2306.11695,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:41.015173Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:4e38b07a6c86032e0b64330d402c48e0cb43efc49d15a5d8ba81b98b3cd6e80d","observation_id":"641e44b7-2516-4e54-9675-b172ff832c84","resolution":{"observed_at":"2026-08-02T03:55:41.015173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08302","last_updated":"2023-05-26T00:17:06Z","snapshot_observed_at":"2026-08-04T07:05:46.232759Z","submitted_at":"2023-03-15T01:27:15Z","title":"ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08302","snapshot_observed_at":"2026-08-02T03:55:41.125011Z","title":"Zeroquant-v2: Exploring post-training quantization in llms from comprehensive study to low rank compensation.arXiv preprint arXiv:2303.08302,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:41.125011Z"},"links":{"cited_paper":"/paper/2303.08302","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:c1600a5f74ad99822a6843882879a15558022fb2a70cfc4b96e710cb54468821","observation_id":"66defc3c-1c96-409c-be9e-3130e323c914","resolution":{"observed_at":"2026-08-02T03:55:41.125011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18403","last_updated":"2024-08-07T03:30:30Z","snapshot_observed_at":"2026-08-06T07:29:40.859648Z","submitted_at":"2023-05-28T15:15:48Z","title":"LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18403","snapshot_observed_at":"2026-08-02T03:55:41.247033Z","title":"Loraprune: Pruning meets low-rank parameter-efficient fine-tuning.arXiv preprint arXiv:2305.18403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:41.247033Z"},"links":{"cited_paper":"/paper/2305.18403","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:d26dc72f85e627ad52c556fb35c9992a5b01cdddb396bae9352df91826c1b114","observation_id":"72c9aa9b-2a55-434a-8003-4f91bdf4d635","resolution":{"observed_at":"2026-08-02T03:55:41.247033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-07-06T15:50:49.116859Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-02T03:55:40.168571Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.168571Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:96e90b836557746d286d7dd05eb7773d81f48ff73a9cb786e11e9acafa9f4877","observation_id":"28dd328d-0752-4925-a4a8-742b323b8eca","resolution":{"observed_at":"2026-08-02T03:55:40.168571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-02T03:55:40.066366Z","title":"Tri Dao, Daniel Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.066366Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:db39ee1edf4360b81e8e10d5c175eb4a84c5718fc28ddad061cc9b26ec3adf13","observation_id":"c3983ad0-d2f4-4b19-9723-3a2430f34d74","resolution":{"observed_at":"2026-08-02T03:55:40.066366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-02T03:55:39.951387Z","title":"FrugalGPT: How to use large language models while reducing cost and improving performance.arXiv preprint arXiv:2305.05176,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:39.951387Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:9500bd74e2f10ada2333844322f11e5a85f75fe6949a5d46b128645cfa0e2b05","observation_id":"b19c3f69-c03e-4e56-aa82-9f815b64f46d","resolution":{"observed_at":"2026-08-02T03:55:39.951387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T21:00:57.912415Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.13735."}