{"as_of":"2026-08-08T20:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2ff2dab71d7c1d1e21ef5a2228fb2322ff2a3eccf2d19ddd1f1bef4b9505fcc","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:55.423637Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-05T05:41:13.869451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-05T05:50:43.590536Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05664","snapshot_observed_at":"2026-07-05T05:50:43.590536Z","title":"Avg. Bits","venue":null,"work_id":"347d84af-c490-4a83-932e-db0386251b5e","year":2025},"citing_paper":{"arxiv_id":"2512.04746","last_updated":"2026-05-18T07:28:29Z","snapshot_observed_at":"2026-08-02T23:38:31.117499Z","submitted_at":"2025-12-04T12:35:10Z","title":"SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T17:08:05.945757Z"},"links":{"cited_paper":"/paper/2506.05664","citing_paper":"/paper/2512.04746"},"observation_digest":"sha256:9abf53418a0cb8e227f22e80522013c09a4c30752a534d483019632c2ab605cc","observation_id":"196ce1c7-1a55-4e9f-98e8-714d0a7fa3c2","resolution":{"observed_at":"2026-05-21T17:10:24.851205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05664","snapshot_observed_at":"2026-07-05T05:50:43.590536Z","title":"Avg. Bits","venue":null,"work_id":"347d84af-c490-4a83-932e-db0386251b5e","year":2025},"citing_paper":{"arxiv_id":"2605.06675","last_updated":"2026-06-26T01:41:50Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T02:31:58Z","title":"RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T01:09:21.811344Z"},"links":{"cited_paper":"/paper/2506.05664","citing_paper":"/paper/2605.06675"},"observation_digest":"sha256:c230af0e4395f2ab05d21298397ec65298f778fbc0cd922eb5d43ffe2e7bb423","observation_id":"db559af4-13dd-4bac-9c2a-f077de7e7051","resolution":{"observed_at":"2026-05-11T04:40:59.669846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05664","snapshot_observed_at":"2026-07-05T05:50:43.590536Z","title":"Avg. Bits","venue":null,"work_id":"347d84af-c490-4a83-932e-db0386251b5e","year":2025},"citing_paper":{"arxiv_id":"2605.06675","last_updated":"2026-06-26T01:41:50Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T02:31:58Z","title":"RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-05T05:41:13.869451Z"},"links":{"cited_paper":"/paper/2506.05664","citing_paper":"/paper/2605.06675"},"observation_digest":"sha256:aaf0c954ae712f5a09178200cd9a63bb409c2e450f553db6cc673b32c3a7d6e3","observation_id":"6267c1b7-0ebd-46ce-94bf-35493f06b28f","resolution":{"observed_at":"2026-07-05T05:50:43.592486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05664/citation-record","integrity":"/paper/2506.05664/integrity","json":"/paper/2506.05664/citation-record.json","paper":"/paper/2506.05664"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.801191Z","title":"Introducing ChatGPT.OpenAI Blog","venue":null,"work_id":"c7ce1d89-2b7a-46d8-9482-881e02b7f8ac","year":null},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.125122Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:50f050e443a6c942312e0db28970f37831cf31802e393ceae11a4c62832ab42c","observation_id":"d542fac4-a47a-4dfa-93b8-fb721f8ba1f6","resolution":{"observed_at":"2026-08-07T10:18:58.981600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.215053Z","title":"Qlora: Efficient finetuning of quantized llms.Advances in neural information processing systems, 36:10088– 10115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.215053Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:0ccd72497dc19389731db04b171b849227f54f5f3d01697f877faabebb2e0790","observation_id":"01ae5068-8aa3-42a2-bb3f-e8dc07648b74","resolution":{"observed_at":"2026-08-07T10:18:51.215053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.356767Z","title":"OPTQ: Accurate quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.356767Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:b03046351330445111e226828dc748f365ca7995d7eb455f38cb9a02a865c486","observation_id":"d37587dc-eb2b-445b-8843-73e5bf796cd0","resolution":{"observed_at":"2026-08-07T10:18:51.356767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T10:18:51.557589Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.557589Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:ac990fe2e0bc71584e76b2fe29206fe7cae2c34a8817f38788733219d94dabf6","observation_id":"c4638107-943c-4efa-842d-ece7443e4e08","resolution":{"observed_at":"2026-08-07T10:18:51.557589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.556204Z","title":"QuIP: 2-bit quantization of large language models with guarantees","venue":null,"work_id":"61f24f6a-44de-485d-b075-54e15ac6c5e7","year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.709490Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:93255ce1563205587eefc94e4f512d1adcfb8b17dd93de67d80a891496bc6e9c","observation_id":"adbbb647-40a9-4e9f-b99c-bc4e58e2d344","resolution":{"observed_at":"2026-08-07T10:18:58.643512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.833564Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.833564Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:95be978c93da96246e8d068a25207987f2cee0cba11b5234a4fa6225093f9ddf","observation_id":"56f249c7-4c10-407a-bcfc-4a6227bbbff0","resolution":{"observed_at":"2026-08-07T10:18:51.833564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.035060Z","title":"Omniquant: Omnidirectionally calibrated quan- tization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.035060Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:4bf6f4fd4b8e43daa342f5a80630bc13c3e79ca979d12e883cdb4c736cc90d22","observation_id":"825ef0da-5999-4b78-9e0e-5247cf497052","resolution":{"observed_at":"2026-08-07T10:18:52.035060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.178887Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.178887Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:a03ad822cb6c3d205d912faaeefe0efeb97a1c4518dbaf53cc91c73a0bb56017","observation_id":"991ba312-d4ad-4764-8e7e-2ebcca51e8a8","resolution":{"observed_at":"2026-08-07T10:18:52.178887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.315397Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of Machine Learning and Systems, 6:87–100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.315397Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:045a19111ad56e27ff7f172a1f24d225b7858fffd4e9b2be9193a2c654e1dd8e","observation_id":"f28f6709-fb4c-4d74-b87c-bdbdfe264093","resolution":{"observed_at":"2026-08-07T10:18:52.315397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.490197Z","title":"Owq: Outlier- aware weight quantization for efficient fine-tuning and inference of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.490197Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:9c73ef52f9af2414bbdd2341558ddd00374101269307093328bbd6b25a297fc6","observation_id":"c08e9e6a-75e3-4440-a082-d8b03450aba9","resolution":{"observed_at":"2026-08-07T10:18:52.490197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T10:18:52.624716Z","title":"Squeezellm: Dense-and-sparse quantization.arXiv preprint arXiv:2306.07629, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.624716Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:a7935635aa85071f7a5dc9c1559a38453d75a183bfc21fab7f54549c62104cd1","observation_id":"35aa94be-e2a4-4b81-aa83-0b824d01744a","resolution":{"observed_at":"2026-08-07T10:18:52.624716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.749496Z","title":"Svirschevski, Vage Egiazarian, Denis Kuznedelev, Elias Frantar, Saleh Ashkboos, Alexander Borzunov, Torsten Hoefler, and Dan Alistarh","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.749496Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:cb0cccd20d08ac77f833a4f7cc917e2a8630e42158a825abccc7ecc136b44298","observation_id":"6b7e28c6-9be5-4042-b20e-ccb2a8fb9961","resolution":{"observed_at":"2026-08-07T10:18:52.749496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.192581Z","title":"Optimal brain surgeon and general network pruning","venue":null,"work_id":"f25127e7-20ea-43ea-870c-76051070c451","year":1993},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.920639Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:6f43cf3c321eca9c2578386d4f72784442600cd6db0808d638e1aab402cf28b1","observation_id":"52fbcbee-8dc5-48c3-b17d-615644050114","resolution":{"observed_at":"2026-08-07T10:18:58.376113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.069213Z","title":"Optimal brain damage.Advances in neural information processing systems, 2, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.069213Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:7b194f6dd240c682973955a9b842fbbcde711186d9fa729e15c035fb89ef254f","observation_id":"c011a7f5-878c-40ab-836e-7053d7aa0c89","resolution":{"observed_at":"2026-08-07T10:18:53.069213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.922879Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":"28b9757a-0825-457c-8a2e-a1072afc51c7","year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.189419Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:dd29e0a74b84e2cfd1c6de9414adaccbfc88b23477faa1f6f4d6210eba6df17e","observation_id":"e00c5e90-9f8a-4caf-8480-2c0e09f4f89c","resolution":{"observed_at":"2026-08-07T10:18:58.061585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.356799Z","title":"Optimal brain compression: A framework for accurate post- training quantization and pruning.Advances in Neural Information Processing Systems, 35:4475– 4488, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.356799Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:abe461cf939d4a7a3d04eec90dec86734b146689651a7b0b2c7eff7e49274a21","observation_id":"20cf8c7a-20cf-4c73-a47d-3e33a7b449c2","resolution":{"observed_at":"2026-08-07T10:18:53.356799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-04T05:18:02.925670Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-07T10:18:53.534133Z","title":"BiLLM: Pushing the limit of post-training quantization for LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.534133Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:6b768a2bfedb618e9c205725b36b9d9258b0a15ac824409510faafa8990d77bd","observation_id":"1e388151-715e-4228-b3cf-11399f60e860","resolution":{"observed_at":"2026-08-07T10:18:53.534133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.582438Z","title":"Gray and David L","venue":null,"work_id":"633c117e-9b25-4525-9b47-b337a8a829c5","year":1998},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.742757Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:c3d810dcd65a96a2d11474977173f647d79b5555b5f7afe4ef9d7e2973b7eaa3","observation_id":"767b367f-c3e5-41fd-9517-9335576483a1","resolution":{"observed_at":"2026-08-07T10:18:57.715317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.878901Z","title":"John Wiley & Sons, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.878901Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:f1bdb87e0fb47a63da3e8062b6164eca324408ea7ca04172512808b85229e877","observation_id":"a549fd08-e043-4463-a65f-5907fc04c75e","resolution":{"observed_at":"2026-08-07T10:18:53.878901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.226491Z","title":"Jpeg2000: Image compression fundamentals, standards and practice.Journal of Electronic Imaging, 11(2):286–287, 2002","venue":null,"work_id":"4a851238-bef5-47c1-99b8-9f2ee5bc56b5","year":2002},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.023364Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:ebc36da1113ec328329d34d0fc4966e540ec05b6bca4c2d0767eb54677d4beca","observation_id":"c8d1f918-2e0c-40cb-aefc-0f4f22b8207d","resolution":{"observed_at":"2026-08-07T10:18:57.352361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.104520Z","title":"Springer Science & Business Media, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.104520Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:4c8e467fb2e1711d01605d682edb98d4daeba64089be9bddc01f2a6b4271aa42","observation_id":"f486d404-4f12-4790-b780-fea2a955d48d","resolution":{"observed_at":"2026-08-07T10:18:54.104520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T10:18:54.262302Z","title":"Diab, Xian Li, Xi Victoria Lin, Todor Mihaylov, Myle Ott, Sam Shleifer, Kurt Shuster, Daniel Simig, Punit Singh Koura, Anjali Sridhar, Tianlu Wang, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.262302Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:bc769d7584c4802affb5024dbe0f8bc00fdb70d1a8d0eb693b56f5256ab24556","observation_id":"dde2d55b-4767-4ea0-bb7d-46e6631a94c3","resolution":{"observed_at":"2026-08-07T10:18:54.262302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.443826Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.443826Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:ddf854cbebdf5c333303fb5d4c9518c93efbc96eba08ccab44d5523a33df7b92","observation_id":"cc1f0635-fd71-45ba-9a48-a4c83394244d","resolution":{"observed_at":"2026-08-07T10:18:54.443826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T10:18:54.621632Z","title":"Pointer sentinel mixture models.arXiv preprint arXiv:1609.07843, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.621632Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:c7e2783031994d265bf768179dcf671f48acd15201aa0bb931b4a7206d95539f","observation_id":"403ab597-f344-4cff-9ee5-8511a7f80c6f","resolution":{"observed_at":"2026-08-07T10:18:54.621632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.891415Z","title":"The Penn Treebank: Annotating predicate argument structure","venue":null,"work_id":"e4ba58f7-35ce-4221-875e-ca98b792e7d4","year":1994},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.807264Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:78286be7dd875b7b6c6649cb1b68cc0e10043d3f02f64ab7745d924b561fa8b3","observation_id":"34702f25-e960-4259-8b8a-e4a69673bc55","resolution":{"observed_at":"2026-08-07T10:18:57.082435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.407062Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"5de51e6e-f16a-46d3-a561-f9f69e8d6c84","year":2016},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:55.087121Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:47acfc5074e022d3bf1f78c8edb512b5929d8e01efe27816f7857ae200d495eb","observation_id":"8e0adfe8-8572-40f5-a731-c30a19440f50","resolution":{"observed_at":"2026-08-07T10:18:56.608156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.134289Z","title":"Piqa: An algebra for querying protein data sets","venue":null,"work_id":"ed31dc3b-178c-4a94-893c-43502ceb69c3","year":2003},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:55.236048Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:ebf201b784d7174511aa6f88603b33e21f9e19eb208dbe8de87d3fa5921c20e7","observation_id":"3d4a6eec-b3dc-41ef-84eb-9abcfb0959b8","resolution":{"observed_at":"2026-08-07T10:18:56.247548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.704828Z","title":"A systematic classification of knowl- edge, reasoning, and context within the ARC dataset","venue":null,"work_id":"fdf1e648-137a-4065-aa29-fed61bd01a18","year":2018},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:55.423637Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:8b3247c4881a5f6f37bc0ca289a287a63e4f6cbd2ec4606921a80911cbad469e","observation_id":"e378cbbd-1a98-4b0f-9598-387bd629d825","resolution":{"observed_at":"2026-08-07T10:18:55.902652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 3 inbound Pith citation observations for arXiv:2506.05664."}